
AI安全性レッドチーマー
Mercorは、敵対的なプロンプトで高度なAIシステムを検証するAI安全性レッドチーマーを募集しています。 リスクを記録し、研究者と連携してモデルの安全性とアライメントを強化する役割です。
仕事内容
- 敵対的なプロンプトを作成し、高度なAIモデルをテストする
- 脱獄、不安全な出力、ハルシネーション、ポリシーの抜け穴を見つける
- 誤情報、サイバーセキュリティ、生物安全保障、詐欺、政治的コンテンツなどのセンシティブな領域でモデルの耐性を評価する
- 脆弱性を記録し、安全性ベンチマークやレッドチーミングレポートの作成を支援する
- AI研究者と協力し、モデルのアライメント、耐性、安全性を強化する
- AIシステムの学習と改善に関するプロジェクトに貢献する
応募要件
- コンピューターサイエンス、サイバーセキュリティ、ジャーナリズム、コミュニケーション、心理学、生物学、化学、公共政策、または関連分野の学士号以上
- AI安全性、AIレッドチーミング、トラスト&セーフティ、サイバーセキュリティ、調査報道、生命科学、または関連分野で5年以上の実務経験
- 優れた分析的思考力、プロンプト設計力、文章力
- 敵対的なプロンプトの作成、または高度なAIシステムの評価経験
- 歓迎条件:AIレッドチーミング、RLHF、教師ありファインチューニング、AIアライメント、またはトラスト&セーフティの経験
- 歓迎条件:脱獄テスト、プロンプトエンジニアリング、または敵対的評価手法に関する知識
- 歓迎条件:サイバーセキュリティ、生物安全保障、政治的コンテンツ、誤情報、科学の安全性など、専門性を要する領域の知見
- 独立請負業者として働けること
- H-1BおよびSTEM OPTの候補者は対象外
福利厚生
- 完全リモート勤務、柔軟なスケジュール
- 提供した業務の報酬をStripeまたはWise経由で毎週支給
- プロジェクト期間は、ニーズや実績に応じて延長、短縮、または早期終了となる場合があります
- 競争力のある報酬
- 第一線の研究者や安全性チームと協力する機会
- 要望に応じて合理的配慮を提供
- 紹介が成立するごとに最大340ドルの紹介報奨金(上限あり)









