メインコンテンツへスキップ
AI News 15分で読める

Sakana AI「Fugu Max」の実力と誤算。フロンティアモデル不要を掲げた東京発AIの光と影

「fugu-ultraのアウトプット、複数ステップタスクでめちゃくちゃ良かった。GPT-5.5を複雑タスクで上回ってる」。Hacker Newsのスレッドにそんな感想が投稿されたのは2026年9月12日の朝だった(出典: Hacker News、2026年9月12日)。

しかし同じスレッドには、まったく逆の声もあった。「APIが遅すぎて実務では使えない。$220/月プランで2時間使ったら使用量上限に達した」。そして最も共感を集めていたのは、どちらでもないコメントだった。「要は高級OpenRouterでしょ?」。

9月11日、東京を拠点とするSakana AIが「Fugu Max」と「Fugu Ultra v2」を公開した(出典: Sakana AI公式ブログ、2026年9月11日)。「フロンティアモデルなしでフロンティアを超える」という主張と、ベンチマーク数値は確かに刺さった。だが、数字の裏側にある構造を理解しないと、誤った期待を持つことになる。

この記事はこんな人におすすめ
  • LLM APIコストを削減したいエンジニア・PM
  • 複数AIを使い分けているが、管理コストに疲れてきた開発者
  • 日本発AIスタートアップの技術動向を追いたい人

フグはモデルではない。オーケストレーター・アーキテクチャの全貌

Fugu(フグ)の最大の特徴は、単体のLLMではないことだ。

リクエストを受け取ったFuguは、まずタスクを分解する。「このサブタスクはコーディング系か?推論系か?視覚処理か?」と判断しながら、プール内の複数のモデルへ振り分ける。各モデルの出力をFuguが束ねて一つの回答として返す。ユーザー側からはAPIが一本あるだけで、中で何が動いているかは見えない(出典: AiCybr アーキテクチャ解説、2026年9月11日)。

このアーキテクチャはICLR 2026(International Conference on Learning Representations、国際学習表現会議)で発表された2本の論文に基づく。

  • TRINITY: 進化的手法で複数LLMを協調させるコーディネーター設計
  • Conductor: 強化学習で自然言語ルーティング戦略を自動発見する手法

重要なのは、モデルプールが意図的に非公開設計になっている点だ。Sakana AIのFAQには「プールはいつでも変更される可能性があり、ユーザーはどのモデルが各プロンプトを処理したかを知ることはできない」と明記されている(出典: Sakana AI公式)。

Fugu Maxでは今回のリリースでNVIDIA Nemotronシリーズがプールに追加された。これはSakana AIとNVIDIAの8月の協業を受けたもので、GPU最適化モデルの取り込みによるコスト圧縮が狙いだ。なお、Fugu Ultra v2についてはFable 5、Fable 5.1、GPT-6 Astraがプールから除外されているとSakana AI公式が発表している。Fable 5の除外は複数のメディアが独立して確認しているが、Fable 5.1とGPT-6 Astraの除外は公式発表のみで第三者確認はまだ限定的だ。

Fugu Max と Ultra v2:価格・性能・選び方

2つのティアの違いは明確だ。

ティア入力出力想定用途
Fugu Max$2/1Mトークン$6/1Mトークン大量処理・コスト重視
Fugu Ultra v2$5/1Mトークン$30/1Mトークン複雑推論・コーディング

Sakana AIは「Fugu Maxの出力コストはSonnet 5・GPT 5.6 Terra・Kimi K3より40〜60%安い」と主張している(出典: DataNorth、2026年9月11日)。

ただし、この価格比較にはGPT-5.6 Solが含まれていない。OrcaRouterの独立分析によると、SolはFugu Maxより出力レートが3倍以上高いが、そもそも価格帯も高いため、Sakana AIが意図的に「比較しやすい競合」を選んで並べた可能性がある(出典: OrcaRouter、2026年9月12日)。

ベンチマーク面では、Fugu Ultra v2が以下の数値を記録している。

  • Chartography(チャートや文書からデータを視覚的に解釈する能力を測るベンチマーク): 48.3。Fable 5が29.5、Opus 5が27.3
  • Terminal Bench 2.1(AIエージェントがターミナル操作を通じてコーディングタスクを自律完了する能力を評価): 90.6。Opus 5の89.1をわずかに上回る
  • SWE-Bench Pro(実際のソフトウェアエンジニアリングタスクの自律達成度を評価): 74.3。コーディングタスクでトップクラス

これらはすべてSakana AI自己計測値で、独立した第三者検証は発表時点では未完了だ(出典: Pondero、2026年9月12日)。

Fugu Maxに開発者が感じた3つの違和感

リリース後のHN・Reddit・X(旧Twitter)を観測すると、開発者コミュニティの反応は「良い数字だが…」という留保付きだった。具体的には3つの批判が繰り返された。

1. 「これはOpenRouterでは?」

最も多く見られたのがこの疑問だ。paddo.devの分析は「Fuguは学習済みルーターである点でOpenRouterとは異なるが、マーケティングと中身のギャップが大きい」と指摘した(出典: paddo.dev、2026年9月12日)。OpenRouterが静的なルール設定によるモデル振り分けであるのに対し、FuguはTRINITY/Conductorに基づく動的な学習済みルーターという違いはある。しかし「学習済みルーター」という説明を聞いて「それは単なるルーティングサービスより複雑なのか?」と感じた開発者は多かった。

2. ブラックボックス問題

どのモデルがどのサブタスクを処理したかが見えない。デバッグが困難で、同じプロンプトへの再現性も担保されない(出典: ayautomate.com、2026年9月12日)。プロダクション用途では、「なぜその出力になったか」を追跡できることが重要な要件になることが多い。プールがいつでも変更され得るという仕様は、本番環境での採用に対するリスクになる。

3. AI主権にならない

The New Stackの記事は構造的な矛盾を突いた。「オーケストレーション層が第三者APIへのルーティングである以上、そのAPIが失われたり制限されたりすれば終わる。これはAI主権ではない」(出典: The New Stack、2026年9月12日)。日本発AIとして期待されるデータ主権の観点から見ると、Fuguはあくまで「有能な取りまとめ屋」であって、依存先のリスクは解消されていない。

それでもFugu Maxが有効な場面

批判を踏まえても、特定の用途ではFugu Maxは合理的な選択になりうる。

出力トークン量が多い高量処理ワークロード。ドキュメント要約・コード生成・データ変換など、出力が長く大量に処理する用途では、Sonnet 5比40〜60%のコスト削減効果が効いてくる。レイテンシへの許容度があり、スループット重視のバッチ処理がそれにあたる。

Anthropic APIの移行コストを下げたい開発者。Fugu Ultra v2はAnthropicのMessages API互換エンドポイントを提供している。既存のAnthropicコード資産を最小限の変更で転用でき、コスト削減の実験を低コストで試せる。

視覚的推論とコーディングが混在するタスク。Chartographyの48.3というスコアは、Fable 5の29.5を上回っている(Sakana AI自己計測値)。PDF読み取り・チャート解析・複合ドキュメント処理が絡む業務では、Fugu Ultra v2が有効に機能する可能性がある。

一方、日常的な開発ワークフローのメインモデルには向かない。HNユーザーが指摘した「2時間で$220/月プランの使用量上限に達した」問題と、APIの遅延は実務上の障壁だ(出典: youmind.com、2026年9月12日)。再現性が求められる本番環境での採用も、プールの非公開・変動仕様がネックになる。

Sakana AI Fugu 料金まとめ(2026年9月時点)
ティア入力 $/1M出力 $/1M特記
Fugu Max$2.00$6.00EU/EEA不可
Fugu Ultra v2$5.00$30.00キャッシュ入力$0.50/1M
Claude Sonnet 5$3.00$15.00参考値
DeepSeek V4 Pro$0.43$0.88参考値

※価格はSakana AI公式発表値。変更の可能性あり。Fugu Ultra v2は272Kトークン超のコンテキストで入力$10/出力$45に価格が変わる点に注意。

Sakana AI Fuguの公式ドキュメントと利用申込みはsakana.ai/fugu/から確認できる。EU・EEA在住の場合は現時点では利用できないため、提供地域の更新を待つ必要がある。

詳しく見る

関連記事


免責事項: 本記事に掲載したベンチマーク数値・価格情報はSakana AI公式発表および報道時点(2026年9月12〜14日)の情報に基づきます。ベンチマークはSakana AI自己計測値を含み、独立した第三者検証が完了していない項目があります。価格・仕様・提供地域は変更される場合があります。投資・調達判断の根拠として使用する際は必ず公式情報を参照してください。

Share