MENU

ニュース

AIの急激な高機能化に歯止め!OpenAIが新モデル「Astra」の懸念から強化学習を一時休止し安全策を先行強化

  • URLをコピーしました!

AIモデルの高性能化に伴い、開発と評価の各段階で安全策の前倒し強化が進んでいます。OpenAIのHugging Face事案と、新モデルAstraが重要なサイバーセキュリティ能力の兆候を示したことを受け、最新モデルの強化学習を2週間休止し、研究環境の強化とレッドチーミング、モニタリングの範囲拡大に注力しました。最大規模のフロンティア強化学習は、行動評価と安全策検証の小規模トレーニングを優先するため保留されています。安全策はモニタリング、アライメント、セキュリティの三本柱で、モデル能力に合わせてスケールさせる方針です。研究環境では、ワークロード分離やネットワーク隔離、継続的なセキュリティテストを導入し、Astraやサイバー関連ワークロードに最も厳格な管理を適用しました。

モニタリングは多段階に拡張され、活性化分類器がサンプルされた全トークンを検査し、懸念は高計算の自動調査にエスカレーションします。ツール操作全体で不正アクセスやデータ窃取、破壊行為、安全対策妨害の有無を追跡し、懸念判明から30分以内のアラート発出を目標にしています。重要境界の違反可能性は最優先で通知され、安全、セキュリティ、研究の各チームが対応し、30分以内に誤検知と断定できなければ活動を停止します。Sol能力以上のモデルに関わる強化学習とツール評価に必須化し、Astraのツール推論にも追加要件を適用しました。計算オーバーヘッドは推論計算のおよそ2割と見積もられています。

アライメント研究では報酬モデルの改善、モデルの正直さの訓練、報酬や採点器、ツールや監督の弱点を突く行動の低減を進めています。外部システムやリソースとの相互作用時に有害となり得る行動を訓練対象に広げ、評価や安全策へ知見を反映します。今後は訓練と展開をまたぐ備えの枠組みを進化させ、モデル支援セキュリティや効果的な監視への投資を継続し、外部組織との連携と技術報告の公開を予定しています。フロンティアモデルの能力加速に対し、理解、整合、確保の取り組みを先行させる姿勢が示されています。

詳しくは「Open AI」の公式ページまで。レポート/DXマガジン編集部

シェアはこちらから
  • URLをコピーしました!
  • DXイノベーション大賞2026
  • 週刊SUZUKI
  • DSW

お問い合わせ

取材のご依頼やサイトに関するお問い合わせはこちらから。

問い合わせる