エージェントコーディング向け Qwen3.6 35B-A3B を追加しました
qwen3.6-35b-a3b を追加しました。Qwen Team が 2026-04-16 に公開した、総パラメータ 35B・アクティブ 3B の軽量 MoE です。単価は入力 ¥45 / 出力 ¥310(1M tok・税込表示)で、Gemma 4 31B より入力は安く、出力は高めです。
エージェントコーディングとマルチモーダルを両立するモデルで、前世代の Qwen3.5-35B-A3B からコーディング系の伸びが大きく、リポジトリ規模の編集やフロントエンド実装に向きます。重みは Apache 2.0 で公開されています。
特徴
35B 総 / 3B アクティブの MoE
256 エキスパートのうち 8 ルーテッド + 1 共有を起動し、実効計算は約 3B です。Gated DeltaNet と Gated Attention を 3:1 で積み上げた 40 層構成で、ネイティブ 262,144 トークンのコンテキストを持ちます(YaRN で最大 1,010,000 まで拡張可能ですが、HAI が提供する上限は 256K です)。HAI が提供する量子化は FP8 です。モデルカードは Hugging Face にあります。
エージェントコーディング
SWE-bench 系や Terminal-Bench、社内のフロントエンド生成ベンチで前世代から大きく伸びています。Thinking Preservation(履歴の思考トレースを保持するオプション)を備え、反復的なエージェント実行での冗長な再思考を減らす設計です。
テキスト・画像・動画入力
入力はテキスト・画像・動画に対応します。HAI で動画を渡せるのは Gemma 4 31B に続く 2 本目です。出力はテキストのみです。
思考は既定 ON
既定では思考してから回答します。思考を止めるには reasoning_effort に "none" を指定します(Qwen3 の /think /nothink ソフトスイッチは公式サポート外です)。思考トークンは出力として課金されます(思考パラメータのお知らせ)。
ベンチマーク(Qwen 公表値)
Qwen はモデルカードでスコアを公表しています。前世代の Qwen3.5-35B-A3B との差が特に大きいのはコーディングエージェント系です。
| ベンチマーク | Qwen3.6 35B-A3B | Qwen3.5 35B-A3B |
|---|---|---|
| SWE-bench Verified | 73.4 | 70.0 |
| SWE-bench Multilingual | 67.2 | 60.3 |
| SWE-bench Pro | 49.5 | 44.6 |
| Terminal-Bench 2.0 | 51.5 | 40.5 |
| Claw-Eval Avg | 68.7 | 65.4 |
| SkillsBench Avg5 | 28.7 | 4.4 |
| NL2Repo | 29.4 | 20.5 |
| LiveCodeBench v6 | 80.4 | 74.6 |
| GPQA | 86.0 | 84.2 |
| AIME 2026 | 92.7 | 91.0 |
前世代に対しては掲載した 10 指標すべてで上回っています。特に Terminal-Bench 2.0(+11.0)と SkillsBench Avg5(+24.3)の伸びが大きく、エージェント実行まわりの改善が中心です。
同じ表の競合列では、SWE-bench Verified で Qwen3.5-27B(75.0)に届かず、VITA-Bench や Tool Decathlon など一般エージェント指標では前世代や Gemma 4 31B を下回る項目もあります。コーディングエージェントに強く、汎用エージェント指標では全面的に上位というわけではありません。
測定条件の例として、SWE-Bench 系は内部エージェント scaffold(bash + ファイル編集)、temp=1.0 / top_p=0.95、200K コンテキストです。Terminal-Bench 2.0 は Harbor/Terminus-2 harness、3 時間タイムアウト、5 回平均です。いずれのスコアも Qwen 自身による測定で、第三者の独立評価ではありません。QwenClawBench と QwenWebBench は自社ベンチマークです。
使い方
model に qwen3.6-35b-a3b を指定します。
curl https://hai-api.hcloud.ltd/v1/chat/completions \
-H "Authorization: Bearer hai_..." \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.6-35b-a3b",
"messages": [{"role":"user","content":"このリポジトリの失敗テストを直す差分を出してください"}]
}'
動画は video_url で渡します。
curl https://hai-api.hcloud.ltd/v1/chat/completions \
-H "Authorization: Bearer hai_..." \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.6-35b-a3b",
"messages": [{
"role": "user",
"content": [
{"type": "video_url", "video_url": {"url": "https://example.com/clip.mp4"}},
{"type": "text", "text": "この動画の内容を 1 文で説明してください"}
]
}]
}'
思考を止める場合は reasoning_effort に "none" を渡します。
curl https://hai-api.hcloud.ltd/v1/chat/completions \
-H "Authorization: Bearer hai_..." \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.6-35b-a3b",
"messages": [{"role":"user","content":"2 + 2 は?"}],
"reasoning_effort": "none"
}'
HAI が受け付けるパラメータは 思考パラメータのお知らせ を参照してください。
Qwen が推奨するサンプリング設定は、一般タスクの思考モードで temperature = 1.0 / top_p = 0.95 / top_k = 20、精密なコーディングでは temperature = 0.6 です。
注意点
- コンテキストは 256K(262,144)トークンです。 1M が必要な場合は Kimi K3 か DeepSeek V4 Flash を使ってください
- 思考は既定 ON です。 単純な抽出・分類でも思考トークンが出力課金に乗ります。止めたい場合は
reasoning_effort: "none"が必要です - Qwen3 の
/think/nothinkは使えません。 公式にはソフトスイッチ非対応です - 出力はテキストのみです
- 画像・動画を渡す URL は正しい Content-Type で配信されている必要があります