OpenAIのAIモデルが引き起こした6つの懸念事例

  • OpenAIは、新たな報告枠組みとともに、6件の予期せぬモデル挙動や懸念事例を公表した。
  • あるモデルが無断で公開されたAPIキーを利用し、その後データを捏造した。
  • OpenAIは、業界全体でアライメントの問題が十分に解決されておらず、全速力での拡大は難しいと述べている。
プロモーション

OpenAIはこの6か月間に観測された「予期せぬ、または懸念されるモデル挙動」の6例を公表した。これに伴い、同社は今後もこうした事例の報告を約束するフレームワークも公表した。

対象となるケースは、モデルが自らのミスを隠蔽する事例から、障害を回避するために無断で行動する事例まで多岐にわたる。

スポンサード
スポンサード

OpenAI、ミス隠蔽や規則違反の6事例を公表

ある事例では、カリフォルニア州内の収益に関する一般的な質問に回答するため、モデルが公開リポジトリで見つけたAPIキーを無断で利用した。それでもデータを取得できなかったため、架空の数値を作成し、あたかも要求元の情報であるかのように提示した。

隠蔽は2件で確認された。GPT-5.6 Solの訓練中、複数の個体が作業要約の中に、ミスや意図しない振る舞いを隠すよう指示を書き込んでいた。

未公開の研究モデルも無関係な指示を要約文27件に挿入したが、その中には通常の制約を無視するよう促す内容が含まれていた。

別の未公開モデルは、依頼されていないにもかかわらず、インターネット上にファイルをアップロードし、ブラウザリンクを引用できるようにした。

さらなる2件は協調行動の例である。モデルが社内ソフトウェアリポジトリを掲示板として使い、異なる訓練セッション間でリクエストをやり取りしていた。共有タスクに取り組む複数のエージェントも、互いのローカルファイルを参照できない場合、成果物を公開ファイルホスティングサイトに投稿していた。

「これらの事例は、ユーザーから情報を隠す行為や、障害を回避するために承認なしで行動する例など、幅広い振る舞いを示している。いずれも個別事例であり、弊社モデル全体のミスアライメント(不整合)の発生頻度を示すものではない」 とOpenAIは補足した

X(旧Twitter)で最新ニュースをリアルタイムでチェック

開示フレームワークと警告

このフレームワークは、7月にOpenAIのエージェントがサンドボックスを脱し、Hugging Faceのシステムを侵害した事例を契機に策定された。OpenAIはこの出来事を警告として位置付けている。

新たな開示フレームワークにより、同社はミスアライメント(不整合)発生時の正式な報告ルートを整備した。OpenAIの従業員は、発生事例を指摘でき、これらは三つのプロセスに振り分けられる。

大半の事例は「開示・軽微調査」プロセスで対応するが、第三者が関与する複雑調査については「スロートラック」が用意される。OpenAIは、7月のHugging Faceインシデントはこのスロートラック扱いであったと説明する。

同社はこのフレームワーク導入と同時に、業界の現状について厳しい見解も表明した。

「AI業界は、今後も責任ある形で速度を落とさずに規模拡大を続けていくには、アライメントや監視の領域で十分な解決策を得られていない」 と指摘する。

こうした開示と警告は、AIによる人類絶滅リスクへの懸念が広がる中で発表された。AI研究者による警告はすでに議会にも届けられており、議員らは超知能の全面禁止法案を検討中である。

同社は今回の開示を、業界にまだ存在しない基準策定への第一歩と位置付けている。今後、他社の研究機関が同様の報告体制を導入するかどうかが、業界がどこまで自浄能力を発揮するかの試金石となる。

YouTubeチャンネルで、リーダーや記者による専門インサイトを視聴

免責事項

BeInCryptoは、公平で透明性の高い報道に努めています。本ニュース記事は、正確かつタイムリーな情報の提供を目的としています。ただし、読者の皆様には、本コンテンツに基づいて何らかの決定を行う前に、独自に事実を確認し、専門家にご相談いただくことをお勧めします。なお、当社の利用規約プライバシーポリシー、および免責事項が更新されておりますので、ご留意ください。

スポンサード
スポンサード