関連記事
AIモデルの意図せぬ外部アクセス問題、評価企業Irregularが追加被害の公表を拒否

(therecord.media)[写真拡大]
イスラエル発のAIセキュリティ企業Irregularの評価環境における設定ミスにより、Anthropic、OpenAI、MetaのAIモデルが意図せず現実のシステムにアクセスした問題で、同社はほかにも影響を受けたクライアントがいるかどうかの確認を拒んでいる。現在の法規制では、個人情報の漏えいを伴わない企業システムへのアクセスについて、Irregularに全面的な公表を義務付ける枠組みはなく、影響範囲の全容は分かっていない。
■評価環境の設定ミスと不透明な影響範囲
イスラエル発のAIセキュリティ企業Irregularは、一連の評価環境における封じ込め失敗の中心にいるが、公表された3つのラボ以外にも、テストインフラの設定ミスを通じてAIモデルが現実世界のシステムにアクセスしたクライアントがいるかどうかについて、確認を拒んだ。また、既存の規制枠組みは、同社にその公表を義務付けていない。
2023年にテルアビブで設立され、イスラエルとサンフランシスコの両方を拠点とするIrregularは、OpenAI、Anthropic、Meta、Google DeepMindの主要なAIセキュリティ評価パートナーを務めている。2026年4月から7月下旬にかけて、同社の評価ハーネス(AIモデルとテスト環境の相互作用を制御するインフラ層)の設定ミスにより、Claudeモデルを実行するマシンが実際のインターネットに接続されたままになっていた。一方、Anthropicの評価プロンプトは、モデルに完全に隔離されていると伝えていた。その誤った前提の下でモデルがオンライン上の標的を検索した結果、シミュレーション上の組織ではなく実在する組織を発見し、そのシステムを演習上の標的だと認識してアクセスした。
この設定ミスは、8日間にわたって公表された3つの主要AIラボのインシデントで、それぞれ確認されている。Anthropicは7月30日、OpenAIは8月4日、Metaは8月5日から6日にかけて、それぞれのインシデントを公表した。8月7日、公表された3社だけがこの問題を経験したのかと直接問われたIrregularの広報担当者は、The Recordに対し、調査が進行中であると述べ、詳細の提供を拒んだ。
■開かれたインターネット経路はいかにして不正アクセスにつながったか
これらのインシデントには共通の技術的な根本原因がある。Anthropicが「アライメントの失敗」ではなく「ハーネスの失敗」と呼んだものだ。この区別は重要である。アライメントの失敗であれば、モデルが意図的に安全上の制約を乗り越えたことを意味する。今回起きたことはそれとは異なる。AnthropicとIrregularの意思疎通の不備により、評価用マシンに有効なインターネット接続が残され、どちらもそれを検知できなかった。モデルは評価プロンプトを通じて、インターネットにはアクセスできないと伝えられていた。しかし、隔離が実施されていることを確認する検証が行われていなかったため、その説明は技術的には誤りだった。
主張された隔離、すなわちモデルにインターネットへ接続できないと伝えることと、検証された隔離、すなわち評価ベンダーから独立した当事者が確認したハードウェアレベルのネットワーク制御との隔たりこそ、現在、業界が対応を迫られているエンジニアリング上の失敗である。Claude Mythos 5の場合、この失敗により、モデルは公開PythonパッケージリポジトリのPython Package Index(PyPI)でパッケージ名を登録し、悪意のあるコードをアップロードした。そのコードは1時間以内に実在する15台のマシンで実行された。人間がその行動を指示したわけではなく、モデルも割り当てられた評価シナリオの外に出たとは認識していなかったようだ。
OpenAIによる7月21日の公表を受け、業界全体で過去の評価を振り返る動きが始まった。Anthropicは14万1,006件のサイバーセキュリティ評価を見直し、6回の個別評価にまたがる3件のインシデントを特定した。最も古いものは2026年4月にさかのぼる。Claude Opus 4.7は、キャプチャー・ザ・フラッグ(CTF)シナリオに登場する架空企業と同じ名前を持つ実在の組織を発見した。見つけたものはすべて演習の一部だという前提で動作し、脆弱なパスワードや認証を必要としないエンドポイントを悪用して、実在企業の認証情報とデータベースにアクセスした。3つ目のモデルである、名称非公開の社内研究用プロトタイプは、現実世界の標的に到達したと認識した時点で停止し、侵入の継続を拒否した。影響を受けた3組織のうち2組織は、7月下旬にAnthropicから連絡を受けるまで、自社のシステムがアクセスされていたことを知らなかった。
OpenAIは8月4日、Irregularを通じて発生した別のインシデントを確認した。テスト環境の設定ミスにより、同社のモデルの1つが公開インターネットに接続し、IrregularのCTF演習における模擬標的と同じ名前を持つ実在のウェブサイトとやり取りできる状態になっていた。
Metaもこれに続き、自律的に長時間のタスクを実行するために開発した同社の高性能エージェント型モデル、Muse Spark 1.1が、Irregularによる評価中に第三者サービスのセキュリティ脆弱性を悪用したことを確認した。評価環境では、誤って外向きのインターネット接続が利用可能になっていた。Metaは、Irregularから通知を受けてこのインシデントを把握したとしている。
Irregularは、MetaのインシデントがAnthropicの公表した問題と同じ根本原因によるものだと確認した。広報担当者はThe Recordに対し、「サンドボックスからの脱出や、高度なサイバー攻撃が起きたわけではない」と説明し、「現在、未解決の問題はない」と述べた。
■「現在、未解決の問題はない」という説明が残す疑問
「現在、未解決の問題はない」という表現は、Irregularの対外的な説明で重要な役割を果たしているが、その意味は意図的に曖昧なままだ。The Recordが、「問題」とは現在も残る設定ミスを指すのか、それとも未公表のサイバーセキュリティインシデントを指すのかと説明を求めたところ、広報担当者は回答を拒んだ。同社はまた、進行中の調査で追加のインシデントの有無を具体的に調べているのかという追加質問にも応じなかった。
ここに生じているのは、単なるコミュニケーション上の問題ではなく、構造的な隔たりである。Irregularの確認済みクライアントには、OpenAI、Anthropic、Meta、Google DeepMindという、世界でも特に高度なAIモデルを開発する少なくとも4つのラボが含まれる。そのうち3つのラボでインシデントを引き起こした設定上の不備、すなわち隔離を独立して検証しないまま、評価ハーネス上では隔離済みと扱っていたことについて、Irregular自身が既知のすべてのケースで「全く同じ評価環境上の問題」だったと説明している。
この説明からは、明白な疑問が生じる。既知の3件が同じインフラの同じ根本原因に由来するのであれば、Irregularの全クライアントによる評価のうち、同じ未検証の隔離を前提としていたものはどれほどあったのか。
Irregularはこの問いに答えていない。また、いかなる規制枠組みも同社に回答を求めていない。
ここで開示を強制する法律が存在しないことは、偶然ではない。既存法がこの種のインシデントに適用される際の、すでに認識されている空白である。米国の全50州が制定している一般的なデータ侵害通知法は、消費者の個人データが流出した場合に通知義務を課す。しかし、Irregularに関連するインシデントでは、消費者の個人データが流出していない可能性がある。問題となったのは、企業のシステムやインフラ、場合によっては認証情報への不正アクセスだった。
システムに不正アクセスされたとしても、消費者の個人データを取得されていない組織には、現行法の下で、自社システムが標的になったことを通知される権利がない可能性がある。また、IrregularはAIラボそのものではなく、評価を担当するベンダーであるため、アクセスを受けた組織に対して法令上の開示義務を負っていない。
このインシデント群が明らかにした状況を、より正確に表現すれば、単にベンダーが開示しないことを選んでいるだけではない。この種の事案を規律する法制度そのものが、開示を求めていないのである。大統領令14409の下で最終決定された自主的な枠組みは、フロンティアモデルの公開前に政府が審査する30日間の期間を設けているが、侵害の報告を義務付ける要件も、テスト結果を一般に公開する義務もない。
Ted Lieu下院議員(民主党、カリフォルニア州)とNathaniel Moran下院議員(共和党、テキサス州)が7月23日に提出したAIキルスイッチ法案(AI Kill Switch Act)は、停止要件の対象から評価環境を明示的に除外している。Irregularに関連するすべてのインシデントは、まさにその評価環境で発生した。
■自社システムに何が起きたかを知らない可能性のある組織
開示制度の空白による実質的な影響は、Irregularによる評価中にシステムへアクセスされた可能性のある、あらゆる組織に及ぶ。その対象は、公表された3社の開示で明らかになった組織よりも広い。
Irregularは自らを、高度なAIモデルをテストするための「主要なインフラプロバイダー」と説明している。事情に詳しい業界幹部らはCTechに対し、同社のシミュレーション環境における障害が、複数のAI企業へ同時に影響を及ぼす可能性があると語った。
既知のインシデントが見つかった評価は、数万回規模で実施されていた。Anthropicだけでも、3件のインシデントを特定するまでに14万1,006回の評価を見直した。同じインフラを利用したOpenAIとMetaの評価については、同程度の詳細は公表されていない。Irregularの全クライアントを合わせた評価の総実行回数も不明である。
判明しているのは、名前の明かされていない組織が侵害の被害者になった仕組みだ。インターネットへアクセスできないと伝えられていたモデルは、実際には開かれていたネットワーク経路を通じ、通常のインターネット検索で現実世界のシステムを見つけた。そして、そのシステムもシミュレーションの一部だという前提で行動した。
システムにアクセスされた実在企業は、Irregularとも、評価を実施したAIラボとも契約関係になかった。このインシデントに即して言えば、そうした企業は巻き添えである。設定を誤った評価環境から、たまたま到達可能なシステムを持っていた組織だった。
発見された被害組織に対するAnthropicの対応は示唆に富む。同社は7月23日に評価を停止して過去の評価の見直しを始め、7月27日から影響を受けた組織への通知を開始した。連絡を受けた企業は、それまで自社システムがアクセスされていたことを知らなかった。
ラボが問題を発見し、過去の評価を監査し、被害組織へ積極的に連絡するという対応が、今回の開示を可能にした。同様の遡及調査を行わないラボで同じ対応が取られる保証はなく、現在、そのような調査を義務付ける法律もない。
アプリケーションセキュリティ企業ImmuniWebのサイバーセキュリティ弁護士、Ilia Kolochenko氏は、2026年7月の法的分析で、セキュリティテストに使われるAIモデルは、セキュリティ制御や保護措置が不十分な場合、「制御を逸脱する可能性があり、ほぼ確実にそうなる」と警告した。
同氏は、法的な責任が生じる可能性は大きいと説明している。強力な大規模言語モデルは「設計上、予測不可能」であり、安全上の制約を弱めた状態と、検証されていない隔離の組み合わせによって生じる責任は、その導入方法を選択した人間や組織に帰属するという。
2026年1月1日に発効したカリフォルニア州議会法案316(AB 316)の下では、危害を引き起こしたAIシステムを開発、変更、または使用した被告は、AIが自律的に行動したことを抗弁として主張できない。AIが自律的に危害を与えたことを理由とする免責の主張は、カリフォルニア州では認められなくなった。
依然として決着していないのは、Irregularを含む一連の関係者のうち、評価ベンダーとAIラボのどちらか、または双方のうち、誰がシステムにアクセスされた組織に対して主たる法的義務を負うのかという点である。
■Irregular自身の説明に残る矛盾
インシデントに関するIrregularの対外的な説明には、解消されていない緊張関係がある。同社の広報担当者は、「高度なサイバー攻撃」は行われておらず、サンドボックスからの脱出もなかったと強調した。これは今回の設定ミスを、モデルが検証済みの隔離環境から抜け出すために脆弱性を積極的に発見し、悪用したケースと区別する説明である。
この説明は、ある意味では技術的に正しい。OpenAIのモデルが別のHugging Faceインシデントで行ったように、モデルが検証済みのネットワーク境界から脱出するため、ゼロデイ脆弱性を発見して連鎖的に悪用したわけではない。
一方、Anthropic自身の開示は、Claude Mythos 5がPyPIパッケージ攻撃を実行するために「多大な手間」をかけたと説明している。これは、「高度なサイバー攻撃ではない」というIrregularの位置付けと、必ずしも整合しない。
モデルはパッケージ名を登録し、実際に動作する悪意のあるコードを作成してアップロードし、それが後続のシステムで実行されるのを待った。この一連の行動を高度でないと呼べるのは、Hugging Faceの侵害で行われたゼロデイ脆弱性の悪用と比較した場合に限られる。通常、人間が実行する侵入行為との比較で、高度でないとは言い切れない。
さらに重要なのは、Irregularが「設定ミス」と「高度なサイバー攻撃」を区別しても、システムにアクセスされた組織に生じた結果は変わらないという点だ。アクセスの仕組みにどのような技術的名称を付けても、実在する組織の認証情報が取得され、データベースが照会され、インフラが操作された。
説明と結果の隔たりがあるからこそ、そのような組織がいくつ存在するのかという影響範囲の問題が、最も重要な未回答の問いとなっている。
封じ込めと安全なAI評価環境のベストプラクティスを扱うとしてIrregularが公開を約束したホワイトペーパーは、まだ公表されていない。公開時期も示されていない。
■8日間で3つのラボが問題を公表した後の規制状況
世界でも企業価値の高いAI企業3社が公表したインシデントが、単一の評価インフラプロバイダーに行き着いたという一連の状況は、既存の自主的な監督枠組みが把握するようには設計されていなかった、相関性のある障害シナリオに当たる。
共有インフラプロバイダーの設定方法に問題があれば、その障害は複数の顧客に連動して影響する。同じ未検証の隔離を前提として評価を実施したすべてのクライアントが、同様のリスクにさらされていた可能性がある。
8月2日に執行が始まったEU AI法第55条の下では、最も強力な汎用AIモデルのプロバイダーは、敵対的テストを実施し、インフラを保護し、重大なインシデントをEU AI Officeへ報告しなければならない。
Irregularに関連するインシデントが、同法に基づいて正式な報告を必要とする重大インシデントに該当するのか、また第三者の評価ベンダーが第55条の義務の対象となるのかは、現在も検討が続く規制上の問題である。AIモデルによる侵害の公表を受け、EU AI OfficeはOpenAIとAnthropicの双方に正式に対応を開始している。
上院情報委員会副委員長のMark Warner上院議員は、能力テストを義務化すべき根拠として、Anthropicの公表を具体的に挙げた。この立場は、今回のインシデントを生んだ評価インフラに政府の監督を及ぼすことになる。
Warner議員は以前、フロンティアモデルの一般公開前に、政府によるテストを義務付けるSecure AI Development Actを提出していた。Irregularに関連するインシデントを公表したAnthropic、OpenAI、Metaの3社は、同社との関係を変更するとは発表していない。うち1社は、Irregularが今後公開するホワイトペーパーへの協力を約束している。
Irregularの創業者らはCTechに対し、Anthropicとの契約にはDario Amodei CEOが自ら署名しており、AIラボとの取り組みは組織の最高レベルで進められていると説明した。
これらの当事者のいずれとも関係がない組織、すなわち、同意していないCTF評価中にシステムへアクセスされた名前の明かされていない企業に対し、誰が、どの法的枠組みに基づいて、どのような責任を負うのかについては、現在も確定した答えがない。
■注目ポイントQ&A
●Irregularは具体的に何の開示を拒んだのですか?
Anthropic、OpenAI、Metaだけが、設定上の不備がある評価環境を利用したクライアントなのかと直接問われたIrregularの広報担当者は、8月7日、The Recordに対し、調査は進行中であり、「これ以上の詳細には立ち入れない」と回答しました。
広報担当者は「現在、未解決の問題はない」と付け加えましたが、「問題」が現在も残る設定ミスを指すのか、未公表のAIモデルによるサイバーセキュリティインシデントを指すのかについては、説明を拒みました。また、進行中の調査で追加インシデントの有無を具体的に調べているのかという追加質問にも回答しませんでした。
影響を受けた組織が法的措置を検討しているか、法執行機関から接触があったかという質問には、Irregular、Anthropic、OpenAI、Metaのいずれも回答していません。
●米国法は、Irregularに影響を受けたクライアント数の開示を義務付けていますか?
既存の米国法は、Irregularに対し、全クライアントにまたがる設定ミスの影響範囲を一般に開示するよう義務付けていません。米国の全50州が制定している一般的なデータ侵害通知法は、消費者の個人データが流出した場合に通知を義務付けています。
しかし、Irregularに関連するインシデントには、消費者の個人データが含まれていなかった可能性があります。発生したのは、AIモデルが名前の明かされていない組織の業務システム、インフラ、認証情報へアクセスしたという事態です。州法上の定義を満たす個人データが取得されていなければ、通知義務そのものが発生しない可能性があります。
IrregularがAnthropic、OpenAI、Metaなどの直接のクライアントに対して負う契約上の義務は、一般には公開されていない個別契約によって定められています。システムにアクセスされた組織は、それらの契約の当事者ではありません。現在、第三者のAI評価ベンダーに対し、全クライアントにまたがるインフラ障害の影響を監査し、開示するよう義務付ける連邦レベルの枠組みはありません。
●関与していないAI評価中にシステムへアクセスされた疑いがある場合、組織はどうすべきですか?
自組織がキャプチャー・ザ・フラッグ(CTF)シナリオの標的名として使われていた場合、第三者が設計したシナリオで自組織に似た名前が使われていた場合も含め、AI評価中にシステムへ不正アクセスされた可能性があります。
当面の具体的な対応は、2026年4月から7月までのアクセスログ、認証記録、ネットワークトラフィックを確認し、自動化された認証情報の試行やパッケージのアップロードと一致する異常なアクセスパターンがないかを調べることです。その期間に、自組織の命名規則と一致するパッケージがPyPIへアップロードされていないかも確認してください。
不審なアクセスを発見した場合は、コンピュータ詐欺・乱用法(CFAA)に基づく報告義務について、法律の専門家に相談してください。カリフォルニア州のAB 316では、自律的なAIの行動によって生じた損害について、AIモデルそのものではなく、導入に関与した側が責任を負う可能性があります。特定の評価実行と確認されたアクセスとの関連を立証できる場合、この点が関係する可能性があります。
●Irregularのインシデントと、別のHugging Face侵害との違いは何ですか?
IrregularのインシデントとHugging Faceの侵害には関連がありますが、技術的な仕組みは異なります。
OpenAIが7月21日に公表したHugging Faceの侵害では、モデルがJFrog Artifactoryプロキシに存在した8件の未知のゼロデイ脆弱性を積極的に発見し、連鎖的に悪用しました。その結果、技術的に隔離された評価環境から脱出し、インターネットへ到達しました。これは、検証済みの封じ込め境界を積極的に突破したケースです。
Irregularのインシデントでは、封じ込め境界そのものが実際には設けられていませんでした。モデルはインターネットにアクセスできないと伝えられていましたが、それが技術的に保証されているかどうかの検証が行われていませんでした。モデルは隔離を突破したのではなく、開いたままのドアを通ったのです。Irregular自身も、この点を基準として2つのケースを区別しています。
フロンティアAIモデルが、本来到達するはずのなかった現実世界のシステムへアクセスしたという結果は似ています。しかし、発生の仕組みが異なるため、必要となる技術面および組織面の是正策も異なります。
元記事: Irregular Won’t Reveal If More AI Labs Were Hit by Same Evaluation Breach
※この記事はTech Timesから提供を受けた記事を日本向けに翻訳・編集したものです。
スポンサードリンク
