有料プラン(3カ月分)を無料プレゼント中!詳しく見る
App IconMemolith
2026年08月05日 07:05(最終更新: 2026年08月06日

オープンウェイトAIがフロンティアに接近、安全対策の公開状況が選定基準になる

執筆: Takumi(Memolith開発者)
メモリスメモリスによる要約
  • GLM-5.2は能力面でGPT-5.5やOpus 4.7に数か月差まで接近とSaferAIが報告
  • GLM-5.2は攻撃的サイバー・生物タスクを一つも拒否しなかった
  • 重みを自前環境で動かすと提供元の安全対策は外れる

モデルの賢さだけを見て選べばいい、と思うかもしれない。だが同じ賢さでも、安全対策の有無まで含めて比べると話は変わってくる。

AI安全性を専門とする非営利団体SaferAIの新しい報告によると、中国Z.aiのオープンウェイトモデル「GLM-5.2」は、サイバー攻撃や生物兵器転用が可能な能力の面で、OpenAIのGPT-5.5やAnthropicのClaude Opus 4.7に数か月差まで迫っているという(TechCrunchの報道)。

差は能力ではなく、対応の側にある。SaferAIがZ.aiの公開APIを通じて実施した評価では、GLM-5.2は与えられた攻撃的サイバー・両用生物タスクのいずれも拒否しなかった。一方Claude Opus 4.7は拒否が一貫していたため、サイバー能力評価用のベンチマークCyberGymを完走できなかったという。SaferAI代表のHenry Papadatos氏はTechCrunchの取材に対し、能力の最前線がそのままリスクの最前線になるわけではなく、リスクを正しく評価するには安全対策の状況も併せて見る必要があると述べている。

この差が実務に効いてくるのは、オープンウェイトモデルの仕組みそのものにある。提供元がAPI経由でどれだけ対策をかけても、重みを自分のサーバーに落として動かした瞬間、その対策は外れる。会議記録や社内文書の整理にAIを使う場面でも能力が並びつつある以上、提供元のAPIを使うか重みを自前環境に置くかという選択自体が、対策の有無を左右する分岐点になる。Z.aiは安全枠組みや事前評価のコミットメント、リスク評価のいずれも公開していないとSaferAIは指摘する。この選択をするのは自社でモデルを動かす組織だけではない。コストやデータ常駐地の都合でオープンウェイトモデルを自前ホストするSaaSベンダーも同じ分岐に立つため、業務ツールを選ぶ側にとっても他人事ではない。

この分岐点を踏まえると、機密文書の処理にオープンウェイトモデルを自前環境で動かす場合は、精度やコストだけでなく、提供元が安全枠組み・事前評価・リスク評価を公開しているかを導入条件に加えるべきだ。業務ツールを選ぶ側も、そのツールがどのモデルを、提供元APIか自前ホストのどちらで動かしているかを確認事項に含めるべきだ。重みを持ち出した時点で提供元の対策は及ばなくなるため、公開情報が無いモデルを使えば、ベンチマークの数値がどれほど良くても、対策の有無を確認できないリスクをそのまま抱え込むことになる。

もう一つの論点は、対策技術そのものの限界だ。学習データから危険な情報を除く「事前学習データフィルタリング」は、CBRN(化学・生物・放射性物質・核)関連の有害情報を除去しても性能はほとんど落ちないとAnthropicが検証しており(Anthropic, Enhancing Model Safety through Pretraining Data Filtering)、既存の安全ファインチューニングは数十ステップ規模の追加学習で崩れるという課題が指摘されており、重みを改変されても崩れにくい「改変耐性」の研究も進む(Deep Ignorance: Filtering Pretraining Data Builds Tamper-Resistant Safeguards into Open-Weight LLMs)。だがサイバー領域は効きにくい。コーディング能力と攻撃的なコード生成能力を学習データの段階で切り分けにくいからだ。したがって「安全対策を実施済み」という説明を、CBRN領域の実績だけを根拠に全リスク領域へ一般化して受け取るべきではない。サイバー領域はCyberGymのような専用ベンチマークの評価結果を個別に確認する必要がある。

メモリス ブログの記事を、Googleで便利に検索できます

Googleで優先ソースとして追加
有料プラン2,490円相当)を
無料プレゼント中!
詳しく見る