Kimi K3はClaude Fable 5を超えたのか?ベンチマーク比較とClaude Codeで使う方法
「中国発のKimi K3がFable 5を超えたらしい」という話題が広がっています。結論から言うと、超えたのは一部のベンチマークで、総合ではまだFable 5が上です。ただし約3分の1の料金とオープンウェイト(公開予定)という文脈を含めると、この評価は単純な勝ち負けでは語れません。この記事では第三者ベンチマークと公式数値を区別しながら実力を整理し、Claude CodeでK3を実際に試す設定手順まで解説します。
結論:「Fable 5超え」はどこまで本当か
先に事実関係を整理します。2026年7月16日にリリースされたKimi K3について、現時点で確認できるのは次の通りです。
- 本当の部分:LMArenaのFrontend Code Arena(フロントエンドコード生成の対人比較)で、K3はClaude Fable 5を抜いて1位を獲得。7つのフロントエンド領域のうち6つで首位です
- 言い過ぎの部分:総合力では第三者評価でもFable 5とGPT-5.6 Solに次ぐ3番手。「全面的にFable 5を超えた」わけではありません
- 見落とされがちな部分:料金はFable 5の約3分の1。さらに7月27日にモデルの重み自体を公開予定(Modified MITライセンス)で、性能そのものより「この性能がこの価格とオープンさで出てきた」ことが本体です
Kimi K3とは?1分でおさらい
Kimi K3は、中国のAI企業Moonshot AIが2026年7月16日にリリースした最新フラッグシップモデルです。
- パラメータ数2.8兆——重み公開が予定されているモデルとしては史上最大級
- 100万トークンのコンテキストと、画像を扱えるネイティブマルチモーダル
- デフォルトで思考(reasoning)モードが有効
- APIは即日提供開始。モデルの重みは7月27日までに公開予定(K2系と同じModified MITライセンスの見込み)
前世代のKimi K2系は「安くて強いオープンウェイトモデル」として開発者に広く使われており、K3はその路線のまま最上位圏に踏み込んできた、という位置づけです。
スペック・料金比較:価格差は約3倍
| 項目 | Kimi K3 | Claude Fable 5 |
|---|---|---|
| 提供元 | Moonshot AI(中国) | Anthropic(米国) |
| リリース | 2026年7月16日 | 2026年6月9日(7月1日に提供再開) |
| 入力価格(100万トークン) | $3.00(キャッシュヒット時$0.30) | $10 |
| 出力価格(100万トークン) | $15.00 | $50 |
| コンテキスト | 100万トークン | 100万トークン |
| マルチモーダル | ネイティブ対応(視覚) | 画像入力対応 |
| 思考モード | デフォルト有効 | 常時ON(無効化不可) |
| モデルの公開性 | 重みを7/27公開予定(Modified MIT) | プロプライエタリ |
| 特記事項 | 重みは執筆時点で未公開 | 安全分類器・30日データ保持必須 |
単価はほぼ3分の1、キャッシュが効く繰り返し処理ならさらに差が開きます。一方でFable 5にはエンタープライズ向けの提供体制(Bedrock・Vertex AI等のクラウド経由)という強みがあります。
ベンチマーク比較:第三者評価と自社公表を分けて見る
第三者評価:総合3番手、フロントエンドは1位
| 評価(第三者) | 結果 |
|---|---|
| GDPval-AA v2(実務タスク総合) | K3は1687で3位。Fable 5 Max(1815)、GPT-5.6 Sol Max(1747.8)に次ぎ、Claude Opus 4.8(1600)を上回る |
| Artificial Analysis 各種指数 | Intelligence 57.11 / Coding 76.24 / Agentic 50.07 |
| LMArena Frontend Code Arena | 1位(前世代K2.6の18位から17ランク上昇、Fable 5を上回る)。7領域中6領域で首位 |
注目すべきは「Opus 4.8超え」です。米国勢の準最上位モデルを、3分の1以下の価格帯のモデルが総合評価で上回ったことになります。
自社公表値:ターミナル操作はFable 5・Solとほぼ互角
| ベンチマーク(Moonshot公表) | K3 | 参考 |
|---|---|---|
| Terminal-Bench 2.1(自律ターミナル操作) | 88.3 | Fable 5:88.0/GPT-5.6 Sol:88.8(いずれも各社自社測定) |
| DeepSWE(コード修正) | 67.5 | — |
| FrontierSWE | 81.2 | — |
Terminal-Bench 2.1は3社とも自社測定のため厳密な横並び比較はできませんが、「ほぼ互角の水準」であること自体は複数の第三者レビューでも支持されています。一方、Fable 5が圧倒的だったSWE-bench Pro(80.3%)に対応するK3の公式スコアは公表されておらず、「一発の難しいコード修正」での直接比較はまだ材料不足です。ベンチマークの名前が似ていても別物(DeepSWE≠SWE-bench Pro)なので、混ぜて比較しないよう注意してください。
Claude CodeでKimi K3を使う方法
K3のAPIはAnthropic互換のエンドポイントを提供しており、Claude Codeのバックエンドを丸ごとK3に差し替えて試せます。実際の使用感を確かめるには一番手軽な方法です。
手順
- Moonshotのプラットフォーム(platform.kimi.ai)でAPIキーを作成する
- 環境変数を設定してClaude Codeを起動する
# Kimi公式ドキュメントの設定(2026年7月時点)
export ANTHROPIC_BASE_URL=https://api.moonshot.ai/anthropic
export ANTHROPIC_AUTH_TOKEN=あなたのMoonshot APIキー # AUTH_TOKENを使う点に注意
export ANTHROPIC_MODEL=kimi-k3
export ANTHROPIC_DEFAULT_OPUS_MODEL=kimi-k3
export ANTHROPIC_DEFAULT_SONNET_MODEL=kimi-k3
export ANTHROPIC_DEFAULT_HAIKU_MODEL=kimi-k3
export ANTHROPIC_DEFAULT_FABLE_MODEL=kimi-k3
export CLAUDE_CODE_SUBAGENT_MODEL=kimi-k3
claude # 起動後 /status でBase URLとモデルがkimi-k3になっているか確認
①コードが中国企業のAPIに送信されます。業務コード・機密情報を扱うプロジェクトでは、社内のデータ取り扱いポリシーと利用規約を必ず確認してください。②Claude Codeの機能との相性は保証外です。モデル差し替えは公式にサポートされた組み合わせではないため、一部機能(スキルの自動発動・サブエージェントの挙動など)が想定通り動かない可能性があります。③Claudeのサブスク枠は使いません。課金はMoonshot APIに対して発生します。試すときは新しいターミナルで環境変数を設定し、普段の環境と分けるのが安全です。
なお、Claude Codeを経由せずMoonshot純正のCLI(Kimi Code CLI)やAPIを直接使う方法もあります。本格採用を検討する場合はそちらも比較してみてください。
どう使い分けるか:現時点の整理
| ケース | おすすめ | 理由 |
|---|---|---|
| フロントエンド・UIコード生成 | Kimi K3を試す価値大 | 対人比較で現在1位。価格も1/3 |
| 難易度の高いバグ修正・大規模改修 | Fable 5 | SWE-bench Pro級の実績はまだFable 5のみ。K3側の比較材料が不足 |
| 大量処理・コスト重視のエージェント運用 | K3が有力候補 | Opus 4.8を上回る総合評価を約1/3の価格で。キャッシュ入力$0.30も強力 |
| 機密コード・エンタープライズ要件 | Fable 5(またはOpus 4.8) | データ管轄・クラウド提供体制・コンプライアンスの成熟度 |
| ローカル・セルフホスト運用 | 7/27の重み公開を待つ | 公開されれば自前GPU環境での運用が視野に(ただし2.8Tは相当な規模のインフラが必要) |
よくある質問
Q. 結局「Fable 5超え」の噂は本当ですか?
フロントエンドコード生成(LMArena Frontend Code Arena)に限れば本当です。総合力では第三者評価でFable 5・GPT-5.6 Solに次ぐ3位で、まだ超えていません。ただしOpus 4.8は総合でも上回っており、「約1/3の価格で米国準最上位超え」という事実だけでも十分にインパクトのある結果です。
Q. Fable 5から乗り換えるべきですか?
全面乗り換えを判断する段階ではありません。リリースから日が浅く、難関コード修正系の比較材料も不足しています。現実的なのは「フロントエンド系タスクや大量処理でK3を試し、難所はFable 5に残す」という併用です。Claude Codeのバックエンド差し替えなら小さく試せます。
Q. モデルの重みが公開されたら自分のPCで動かせますか?
2.8兆パラメータという規模のため、個人のPCでの実行は現実的ではありません。重み公開の恩恵を直接受けるのは、大規模GPUクラスタを持つ企業・研究機関や、それをホストするクラウド事業者です。個人ユーザーにとっては「ホスティング事業者間の価格競争でさらに安くなる」形で恩恵が回ってくる可能性が高いでしょう。なお執筆時点(7月18日)で重みはまだ未公開で、7月27日までの公開が予告されている段階です。
Q. 安全性やデータの扱いはどうなっていますか?
Moonshot APIの利用ではコード・プロンプトが中国企業のサーバーに送信されます。個人の学習・検証用途では大きな問題になりにくい一方、業務利用では所属組織のポリシー確認が必須です。この点は、30日データ保持や安全分類器という制約はあってもエンタープライズ体制が整っているFable 5と性格が大きく異なる部分です。
まとめ
- Kimi K3の「Fable 5超え」はフロントエンドコード生成(LMArena 1位)では事実。総合ではFable 5・Solに次ぐ3位
- ただし総合評価でOpus 4.8を上回っており、約1/3の価格($3/$15)を考えるとコスパは突出
- Terminal-Bench 2.1は88.3でFable 5・Solとほぼ互角(各社自社測定)。難関コード修正の直接比較はまだ材料不足
- Anthropic互換APIでClaude Codeのバックエンドを差し替えて試せる(機密コードの送信先には注意)
- 7月27日予定の重み公開(Modified MIT)が本当のインパクト。ホスティング競争でさらに安くなる可能性
気になっている方は、機密性のない個人プロジェクトでClaude Codeのバックエンドを差し替えて、普段Fable 5に投げているタスクをそのままK3に投げてみてください。ベンチマークの数字より、自分のワークフローでの体感が一番確かな判断材料になります。


