メインコンテンツへスキップ
AI News 20分で読める

Ox Alpha正体暴露全記録:匿名AIが48時間でGLM-5.3-Flashと特定された話

「先週、コーディングエージェントが、公式には存在しないモデルから返答し始めた」。開発者のAniruddha Adakはそう書いた(DEV Community, 2026年8月)。

2026年8月20日、OpenRouterにstealth/ox-alphaという謎のモデルが現れた。発売キーノートもなく、会社名もなく、モデルカードもない。無料。コンテキスト100万トークン。そしてDeepSWEコーディングベンチマークで「80%」という数字が出た瞬間、開発者コミュニティは真剣に沸騰した。

その後48時間で起きたことは、AIベンチマーク論争よりも面白い話だ。

この記事はこんな人におすすめ
  • 無料・オープンウェイトのコーディングAIを探しているエンジニア
  • 「中国のAI」を業務で使うリスクを正確に把握しておきたいエンジニアリングマネージャー
  • AIコミュニティがどうやってモデルの正体を特定するかに興味があるエンジニア

8月20日:名前のないAIが出現した

このステルスモデルのモデルIDは stealth/ox-alpha、プロバイダ名は stealth。説明文に書かれていたのは「コーディング、長時間タスク、テキスト・画像・動画の複合入力向けに構築されたモデル」だけだった。

OpenRouterは自社が開発者ではないと明記した。「匿名の第三者プロバイダがプレビュー期間中は身元非公開を選択した」というのが唯一の説明だ。

スペック上の数値は異常だった。コンテキストウィンドウ1,048,576トークン(約100万)、最大出力131,072トークン、テキスト・画像・動画の入力、ツール使用対応。そしてプレビュー期間中の価格は入出力ともに$0.00。

Stripe CEOのパトリック・コリソンがXで「非常に印象的だ」と投稿した。コリソンが代表するStripeはOpenRouterを100億ドルで買収済みだ(Stripe-OpenRouter買収の詳細はこちら)。この一言が「開発者インターネットの半分」を試用に向かわせた、とある記者は書いた(The Next Web, 2026年8月)。

最初の2日間でOpenRouter上のプロンプトトークンは約6,570億、補完トークンは約79.5億に達したとされる(Z.ai発表値)。最も多く使ったアプリはClaude Code、Hermes Agent、ZedというAIコードエディタだった。

「本当に80%なのか」— ベンチマーク論争

話題の発端は開発者Ben Davis(@davis7)が8月21日にDeepSWEで実施した10タスクテストだ。Ox Alphaは80%を記録。Claude Fable 5の65%、GPT-5.6 Solの52%を上回った(いずれもDavis独自の10タスク実行値)(OX Alpha Benchmarks - local-ai-zone.github.io)。

ただしDavis自身はツイートの中で「10タスクなのでスコアの分散が大きい可能性がある」と注記していた。「10タスクのベンチマークでは、1タスクの結果で10ポイント変動する」という当然の統計的事実だ。

その後コミュニティが動いた。GitHubリポジトリ MatchaOnMuffins/oxalpha ではDeepSWE用評価フレームワークpierを使い、20時間39分かけて113タスクの全量評価を実施。結果は66/113 = 58.4%(GitHub - MatchaOnMuffins/oxalpha)。評価ハーネスのバージョン差によるとみられる別の全量実行では約62.8%となった。

公式リーダーボードにおけるGPT-5.6 Solのスコアは72.7%、Claude Fable 5は約70%だ(いずれも公式リーダーボード値)(GPT-5.6 Sol レビューはこちら)。Ox Alphaの本当の実力はその下、ただし「無料・オープンウェイト」という条件を加えれば十分に注目に値するポジションにいる。

失敗の内訳を見ると別の問題も見えてくる。113タスクのうち不完全な推論が31件、タイムアウトが5件、ツール呼び出し形式エラーが11件。全エピソードの46%に「ツール呼び出しを含まない不正なレスポンス」が含まれていた。バイナリの成否評価が「惜しいミス」を失敗と同列に扱う問題も指摘されている。

ユーザーの実感

Xの@Hesamationはベンチマーク数値より踏み込んだ評価をした。「もしこれが実際にGLM Flashや小型オープンウェイトモデルで、1〜2台のDGX Sparkで動かせるなら、計算コスト対性能比は狂気的だ」(X/@Hesamation, 2026年8月21日)。

DEV Communityに投稿したAniruddha Adakは1週間の実際の開発作業でOx Alphaを使い続けた。体感的には「存在しないはずのモデルが、十分に使えるコードを出し続けた」という評価だった(DEV Community, 2026年8月)。

コミュニティの探偵術:48時間で正体を暴いた5つの手がかり

Hacker Newsにスレッド「Behaviorally fingerprinting Ox Alpha’s provenance」が立った。Redditは「コールドケースを追う真犯罪フォーラム」のように動き、コミュニティは系統的な調査を開始した。

研究者Joseph W. Elstnerは文字体系・絵文字・コード・SQLにわたる95のプローブ文字列を投入し、既知のモデルとトークン数を比較した。全95件がZhipu AIのGLM-5系語彙と完全一致した(implicator.ai, 2026年8月22日)。

手がかり1:トークナイザの指紋

プロンプトに特定の文字列を送り、返ってきたトークン数をモデルごとに比較する。Ox Alphaは25のテストプロンプトでGLM-5.3と完全一致し、差分は一定の+75トークンオフセット(隠れたシステムプロンプトによるとみられる)のみだった。他のどのモデルとも一致しなかった。

手がかり2:絵文字の出現頻度

同じプロンプトに対する絵文字の使用率を測定した結果、Ox Alphaは1,000文字あたり約1.3個の絵文字を生成した。Claude、GPT-5.6、Grokはいずれも同条件でほぼゼロ。GLM/Qwen系モデルの傾向と一致する。「Redditは絵文字を数えてモデルを特定しようとしている」と各メディアが報じた理由がこれだ(aiangst.com, 2026年8月)。

手がかり3:Javaスタックトレースの漏洩

不正な形式のリクエストを送ると、バックエンドがJavaのスタックトレースを生のエラーとして返した。クラス名はcom.wd.paas.api.domain.v4.chat.ChatCompletionRequest。これはZhipu AIの公式APIルート/api/paas/v4/chat/completionsと正確に対応する(explainx.ai, 2026年8月)。

手がかり4:エラーコードの署名

不正リクエストへのレスポンスに{"code":"1214","message":"Incorrect role information"}が含まれていた。GLM-5.3、GLM-5.2、GLM-5V-TurboのOpenRouterエンドポイントでも全く同じエラーコードが返る。DeepInfraでホストされる同じGLM-5.2の重みはpydanticエラーを返すため、1214はZ.aiのサービングインフラ固有の署名だとわかる。

手がかり5:動画トークン消費パターン

動画を入力したときのトークン消費量のパターンを比較すると、Ox AlphaはZhipu AIのマルチモーダルエージェントモデルGLM-5V-Turboと、3つの独立した設計選択で一致した(Gate.com News, 2026年8月)。

Crawl4AI作者のHossein(@unclecode)はこの過程でオープンソースツールmodelprintを公開し、「配管は嘘をつかない。振る舞いはつく」(“The plumbing doesn’t lie. The behavior does.”)と表現した(X/@unclecode, 2026年8月22日)。研究者のChetasluaはHacker Newsで「これはモデルの性格を推測するより質的に異なるクラスの証拠だ」として98%の確信度でZ.ai GLM系と断定した。

データプライバシーと制裁リスクという影

コミュニティが盛り上がる一方で、見えにくいリスクが2つあった。

プロンプトの行方が最初の問題だ。OpenRouterのモデルページには「プロンプトと補完はプロバイダに保持される(学習利用なし)」と書かれていた。だが同じモデルがOpenCodeでは「ゼロ保持」と表記されるなど矛盾があった。TechCrunchは「誰がAIコーディングモデルOx Alphaを作ったのか、コードはどこへ行くのか誰も知らない」と見出しをつけた(TechCrunch, 2026年8月23日)。

セキュリティ研究者の勧告は明確だった。「プロンプトはすべて公開されたものとして扱え」。プロプライエタリなコードや顧客データをOx Alphaに送っていた人は、名前も分からないプロバイダのサーバーにそれを預けていたことになる。

制裁企業の可能性という問題もあった。コミュニティがZ.ai(旧Zhipu AI)と特定するにつれ、別の事実が浮かんだ。米商務省は2025年1月16日、Zhipu AIを「中国の軍近代化を推進している」としてエンティティリストに追加している(VKTR, 2026年8月23日)。Z.aiへの改名は法人の変更を伴わないため、制裁指定はそのまま引き継がれる。医療や金融の企業開発者が機密コードを送っていた場合、規制リスクが発生していた可能性がある。

The New Stackは「Ox Alphaの本当の謎は誰が作ったかではない」と書いた。データ条件の不透明さの方が深刻だ、という主張だ(The New Stack, 2026年8月)。

8月26日:Z.aiが認め、MITで公開した

8月26日夜(UTC+8)、Z.aiはBloombergに対し「Ox AlphaはGLM-5.3-Flashだ」と認めた。同日、OpenRouterのカタログがstealth/ox-alphaからz-ai/glm-5.3-flashに更新され、HuggingFaceにMITライセンスの重みが公開された。

Z.aiの公式コメントは明快だった。「正式公開前に、リアルなユーザーフィードバックを収集するために匿名でテストした」。

ただしコミュニティが読み取ったのはもう一つの意図だ。プレビュー期間中、Ox Alphaは134,000人のユーザーから7.1兆トークンのデータを収集した。名前を伏せたままベンチマーク結果と実使用フィードバックを積み上げ、ブランドを乗せるタイミングで一気に公開する。Z.aiはGLM-5そのものを同じ手法(当時のコードネームは「Pony Alpha」)で2026年2月にも試みていた。ステルスローンチはZ.aiの確立した戦略だ。

発表文には一行が追加されていた。「GLM-5.3-Flashは完全に中国製AIチップで動作している」。プレビュー期間中に1日100兆トークンのキャパシティをNVIDIA以外のチップで処理したという主張だ。米国の輸出規制が続く状況で、これは技術的な成果であると同時に政治的なメッセージでもあった(WCCFTech, 2026年8月26日)。

GLM-5.3-Flashのアーキテクチャは、GLM-5.3フラッグシップと比べてアテンション計算を3.01倍削減、KVキャッシュを4.44分の1に圧縮するハイブリッドスパース+線形アテンションを採用する。パラメータ総数は320B(Mixture of Experts: MoE、実効18B)、コンテキスト100万トークン、テキスト・画像・動画のネイティブマルチモーダル入力に対応する。GLM-5シリーズ初のネイティブマルチモーダルモデルだ(Z.AI開発者ドキュメント)。

GLM-5.3-Flash スペック早見表
項目詳細
正体Z.ai(旧Zhipu AI)製
アーキテクチャMoE 320B総/18B実効、ハイブリッドアテンション
コンテキスト1,048,576トークン
入力テキスト・画像・動画
ライセンスMIT(Hugging Face公開)
API価格入力$0.075/M、出力$0.25/M(9/9までキャンペーン価格)
DeepSWE(10タスク)80%(参考値)
DeepSWE(113タスク)約62.8%(コミュニティ評価)

関連記事


本記事に記載のベンチマークスコアは2026年8月時点のものです。AIモデルの性能は継続的に更新されるため、最新情報はZ.ai公式サイトおよびArtificial AnalysisなどのLLM評価サイトで確認してください。エンティティリスト記載企業のサービス利用に関しては、所属組織の法務・コンプライアンス部門に相談することを推奨します。

Share