汎用モデル Kimi K2.6 を追加しました
kimi-k2.6 を追加しました。Moonshot AI が 2026-04-21 に公開した、汎用のマルチモーダル・エージェントモデルです。単価は入力 ¥205 / 出力 ¥915(1M tok・税込表示)で、画像を扱えるモデルとしては HAI で最も安価です。
推論・検索・視覚をまとめて扱える汎用モデルで、実用上の特徴は思考を OFF にできることです。
特徴
思考の ON / OFF を選べる
既定では思考(reasoning)が有効です。reasoning_effort に "none" を指定すると、思考せずに即答する Instant モードに切り替わります。
「9.11 と 9.9 はどちらが大きい?一言で。」を HAI 経由で投げた実測では、既定では上限に設けた 300 トークンをすべて思考に使い切って回答本文に到達せず、"none" では出力 6 トークンで回答が完了しました。思考トークンは出力として課金されるため(思考パラメータのお知らせ)、分類・抽出・整形のような単純な用途では実費が大きく変わります。
実測では "none" だけが思考 OFF に対応し、"low" / "high" はいずれも思考 ON になりました。事実上 ON / OFF の 2 択として使ってください。
エージェントと深い検索に強い
アーキテクチャは Kimi K2.5 と同じ Mixture-of-Experts で、総パラメータ 1T・アクティブ 32B です(384 エキスパートから 8 + 共有 1 を選択、61 層、MLA アテンション)。ツールを与えたタスクでの伸びが大きく、Humanity's Last Exam(ツールあり)は 54.0 で GPT-5.4 の 52.1・Claude Opus 4.6 の 53.0 を上回ります。重みは Hugging Face で Modified MIT ライセンスとして公開されています。
サブエージェントを並列に立てる Agent Swarm は、300 サブエージェント・4,000 ステップまで拡張されました(K2.5 は 100 サブエージェント・1,500 ステップ)。HAI は単一の推論 API なので、この構成を使うにはエージェント枠組み側で並列実行を組む必要があります。
画像入力に対応
K2 系で共通の MoonViT(400M)ビジョンエンコーダを持ち、スクリーンショットや図表をそのまま渡せます。HAI で画像を扱えるのは Kimi K3 とこのモデルの 2 つで、単価はこのモデルが低くなります。
ベンチマーク(Moonshot AI 公表値)
Moonshot AI はモデルカードと技術ブログでスコアを公表しています。エージェントとコーディングでは GPT-5.4・Claude Opus 4.6 と並ぶか上回り、実際の GitHub Issue を解かせる SWE-Bench Pro では 58.6 で両者より上です。前世代の Kimi K2.5 は 50.7 で、世代間の伸びは 7.9 ポイントです。
| ベンチマーク | K2.6 | GPT-5.4 | Claude Opus 4.6 | Gemini 3.1 Pro |
|---|---|---|---|---|
| HLE-Full(ツールあり) | 54.0 | 52.1 | 53.0 | 51.4 |
| BrowseComp | 83.2 | 82.7 | 83.7 | 85.9 |
| DeepSearchQA (accuracy) | 83.0 | 63.7 | 80.6 | 60.2 |
| Toolathlon | 50.0 | 54.6 | 47.2 | 48.8 |
| OSWorld-Verified | 73.1 | 75.0 | 72.7 | - |
| Terminal-Bench 2.0 | 66.7 | 65.4* | 65.4 | 68.5 |
| SWE-Bench Pro | 58.6 | 57.7 | 53.4 | 54.2 |
| SWE-Bench Verified | 80.2 | - | 80.8 | 80.6 |
| LiveCodeBench (v6) | 89.6 | - | 88.8 | 91.7 |
| HLE-Full(ツールなし) | 34.7 | 39.8 | 40.0 | 44.4 |
| AIME 2026 | 96.4 | 99.2 | 96.7 | 98.3 |
| GPQA-Diamond | 90.5 | 92.8 | 91.3 | 94.3 |
| MMMU-Pro | 79.4 | 81.2 | 73.9 | 83.0* |
ツールを外した純粋な推論・数学ではまだ届いていません。ツールなしの HLE-Full は 34.7 で GPT-5.4 の 39.8・Gemini 3.1 Pro の 44.4 に劣り、AIME 2026 も 96.4 対 99.2 です。エージェント系でも Toolathlon と OSWorld-Verified は GPT-5.4 が上で、全面的に上位というわけではありません。
測定条件は、K2.6 が思考モード有効・temperature = 1.0 / top_p = 1.0・262,144 トークンコンテキスト、GPT-5.4 が xhigh、Claude Opus 4.6 が max effort、Gemini 3.1 Pro が thinking high です。コーディング系は 10 回の平均値です。* は公表値が無く Moonshot AI が同条件で再測定した数値、それ以外の他社スコアは各社の公表値の引用で、いずれも第三者の独立評価ではありません。DeepSearchQA の他社スコアは Claude Opus 4.7 System Card からの引用である一方、K2.6 側はコンテキスト管理なし・上限超過は失敗扱いという条件での測定なので、差をそのまま実力差とは読めません。
独立評価(Artificial Analysis)
第三者の測定では、Artificial Analysis の評価が Intelligence Index で 54。Anthropic / Google / OpenAI の 57 に次ぐ総合 4 位で、オープンウェイトのモデルとしては首位です。
エージェント性能の指標である GDPval-AA は 1520 Elo(K2.5 は 1309)、τ²-Bench Telecom は 96%。ハルシネーション率は 39% で、K2.5 の 65% から大きく下がり、Claude Opus 4.7(36%)や MiniMax-M2.7(34%)と同水準です。
一方で思考トークンの消費は多く、Intelligence Index の全走査で約 1.6 億トークンを使っています(Claude Sonnet 4.6 は約 1.9 億、GPT-5.4 は約 1.1 億)。
上位の Kimi K3 との住み分け
Moonshot AI が Kimi K3 の公表資料で示している同条件の比較では、K3 が K2.6 を上回ります。
| ベンチマーク | Kimi K3 | Kimi K2.6 |
|---|---|---|
| HLE-Full(ツールあり) | 58.7 | 54.0 |
| SWE-Bench Pro | 63.4 | 58.6 |
| Terminal-Bench 2.0 | 71.8 | 66.7 |
HAI での単価は K3 が入力 ¥750 / 出力 ¥3,750 で、K2.6 の約 3.7 倍 / 約 4.1 倍です。コンテキストも K3 は 1M トークンあります。長い会話や巨大な差分を扱うワークフロー、スコアを優先する用途では K3、コストと速さを優先する用途では K2.6 が向きます。
使い方
model に kimi-k2.6 を指定します。
curl https://hai-api.hcloud.ltd/v1/chat/completions \
-H "Authorization: Bearer hai_..." \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k2.6",
"messages": [{"role":"user","content":"このグラフから読み取れる要点を 3 つ挙げてください"}]
}'
思考を OFF にする場合は reasoning_effort に "none" を渡します。
curl https://hai-api.hcloud.ltd/v1/chat/completions \
-H "Authorization: Bearer hai_..." \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k2.6",
"messages": [{"role":"user","content":"次の住所を JSON に整形してください: 東京都千代田区..."}],
"reasoning_effort": "none"
}'
Moonshot AI が推奨するサンプリング設定は、思考 ON で temperature = 1.0、思考 OFF で temperature = 0.6、どちらも top_p = 0.95 です。
Claude Code から使う場合は環境変数を差し替えてください。
export ANTHROPIC_BASE_URL=https://hai-api.hcloud.ltd
export ANTHROPIC_AUTH_TOKEN=hai_...
export ANTHROPIC_MODEL=kimi-k2.6
export ANTHROPIC_SMALL_FAST_MODEL=deepseek-v4-flash
claude
注意点
- コンテキストは 256K(262,144)トークンです。 他のモデルの 1M より低くなります
- 思考を OFF にできるのは
/v1/chat/completionsのreasoning_effort: "none"だけです。/v1/responsesのreasoning: { effort: "none" }と/v1/messagesのthinking: { type: "disabled" }は、現状いずれも反映されず思考 ON のままになります(実測)。Claude Code から使う場合も思考は常に有効です - 入力はテキストと画像のみです。モデル自体は動画入力に対応しますが、Moonshot AI の公式 API 限定の実験機能で、HAI では使えません
- 出力はテキストのみです