リリース

エージェントコーディング向け Qwen3.6 35B-A3B を追加しました

qwen3.6-35b-a3b を追加しました。Qwen Team が 2026-04-16 に公開した、総パラメータ 35B・アクティブ 3B の軽量 MoE です。単価は入力 ¥45 / 出力 ¥310(1M tok・税込表示)で、Gemma 4 31B より入力は安く、出力は高めです。

エージェントコーディングとマルチモーダルを両立するモデルで、前世代の Qwen3.5-35B-A3B からコーディング系の伸びが大きく、リポジトリ規模の編集やフロントエンド実装に向きます。重みは Apache 2.0 で公開されています。

特徴

35B 総 / 3B アクティブの MoE

256 エキスパートのうち 8 ルーテッド + 1 共有を起動し、実効計算は約 3B です。Gated DeltaNet と Gated Attention を 3:1 で積み上げた 40 層構成で、ネイティブ 262,144 トークンのコンテキストを持ちます(YaRN で最大 1,010,000 まで拡張可能ですが、HAI が提供する上限は 256K です)。HAI が提供する量子化は FP8 です。モデルカードは Hugging Face にあります。

エージェントコーディング

SWE-bench 系や Terminal-Bench、社内のフロントエンド生成ベンチで前世代から大きく伸びています。Thinking Preservation(履歴の思考トレースを保持するオプション)を備え、反復的なエージェント実行での冗長な再思考を減らす設計です。

テキスト・画像・動画入力

入力はテキスト・画像・動画に対応します。HAI で動画を渡せるのは Gemma 4 31B に続く 2 本目です。出力はテキストのみです。

思考は既定 ON

既定では思考してから回答します。思考を止めるには reasoning_effort"none" を指定します(Qwen3 の /think /nothink ソフトスイッチは公式サポート外です)。思考トークンは出力として課金されます(思考パラメータのお知らせ)。

ベンチマーク(Qwen 公表値)

Qwen はモデルカードでスコアを公表しています。前世代の Qwen3.5-35B-A3B との差が特に大きいのはコーディングエージェント系です。

Qwen3.6 35B-A3B と前世代 Qwen3.5 35B-A3B のベンチマーク比較。SWE-bench Verified が 73.4 対 70.0、SWE-bench Multilingual が 67.2 対 60.3、SWE-bench Pro が 49.5 対 44.6、Terminal-Bench 2.0 が 51.5 対 40.5、Claw-Eval Avg が 68.7 対 65.4、SkillsBench Avg5 が 28.7 対 4.4、NL2Repo が 29.4 対 20.5、LiveCodeBench v6 が 80.4 対 74.6、GPQA が 86.0 対 84.2、AIME 2026 が 92.7 対 91.0

ベンチマーク Qwen3.6 35B-A3B Qwen3.5 35B-A3B
SWE-bench Verified 73.4 70.0
SWE-bench Multilingual 67.2 60.3
SWE-bench Pro 49.5 44.6
Terminal-Bench 2.0 51.5 40.5
Claw-Eval Avg 68.7 65.4
SkillsBench Avg5 28.7 4.4
NL2Repo 29.4 20.5
LiveCodeBench v6 80.4 74.6
GPQA 86.0 84.2
AIME 2026 92.7 91.0

前世代に対しては掲載した 10 指標すべてで上回っています。特に Terminal-Bench 2.0(+11.0)と SkillsBench Avg5(+24.3)の伸びが大きく、エージェント実行まわりの改善が中心です。

同じ表の競合列では、SWE-bench Verified で Qwen3.5-27B(75.0)に届かず、VITA-Bench や Tool Decathlon など一般エージェント指標では前世代や Gemma 4 31B を下回る項目もあります。コーディングエージェントに強く、汎用エージェント指標では全面的に上位というわけではありません。

測定条件の例として、SWE-Bench 系は内部エージェント scaffold(bash + ファイル編集)、temp=1.0 / top_p=0.95、200K コンテキストです。Terminal-Bench 2.0 は Harbor/Terminus-2 harness、3 時間タイムアウト、5 回平均です。いずれのスコアも Qwen 自身による測定で、第三者の独立評価ではありません。QwenClawBench と QwenWebBench は自社ベンチマークです。

使い方

modelqwen3.6-35b-a3b を指定します。

curl https://hai-api.hcloud.ltd/v1/chat/completions \
  -H "Authorization: Bearer hai_..." \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.6-35b-a3b",
    "messages": [{"role":"user","content":"このリポジトリの失敗テストを直す差分を出してください"}]
  }'

動画は video_url で渡します。

curl https://hai-api.hcloud.ltd/v1/chat/completions \
  -H "Authorization: Bearer hai_..." \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.6-35b-a3b",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "video_url", "video_url": {"url": "https://example.com/clip.mp4"}},
        {"type": "text", "text": "この動画の内容を 1 文で説明してください"}
      ]
    }]
  }'

思考を止める場合は reasoning_effort"none" を渡します。

curl https://hai-api.hcloud.ltd/v1/chat/completions \
  -H "Authorization: Bearer hai_..." \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.6-35b-a3b",
    "messages": [{"role":"user","content":"2 + 2 は?"}],
    "reasoning_effort": "none"
  }'

HAI が受け付けるパラメータは 思考パラメータのお知らせ を参照してください。

Qwen が推奨するサンプリング設定は、一般タスクの思考モードで temperature = 1.0 / top_p = 0.95 / top_k = 20、精密なコーディングでは temperature = 0.6 です。

注意点

単価とモデル一覧は料金ページ、モデル ID とセットアップ手順はドキュメントに掲載しています。

← 新着情報一覧へ

今日から、baseURL を差し替えるだけ。

コンソールを開く