Qwen4 系アーキテクチャの先行版 Qwen3.8 Flash Next を追加しました
qwen3.8-flash-next を追加しました。Alibaba の Qwen チームが 2026 年 8 月に公開した、次世代 Qwen4 の基盤となるアーキテクチャを先行して採用したオープンウェイトモデルです。単価は入力 ¥30 / 出力 ¥95(1M tok・税込表示)で、カタログ最安帯の glm-5.3-flash(入力 ¥30 / 出力 ¥100)とほぼ同じ価格帯です。
既存の Qwen3.8 27B(qwen3.8-27b)とは別のモデルとして追加しています。27B は dense、Flash Next は 125B/6B の MoE で、同じ Qwen3.8 世代でも構造が違います。ベンチマーク上は多くの指標で 27B を上回っており、コーディングエージェントやマルチモーダルのワークロードをより低い単価で回したいときの選択肢になります。
特徴
125B/6B の MoE に 51B の N-gram Embedding を重ねる
総パラメータ 125B・アクティブ 6B の Mixture-of-Experts(512 experts、routed 10 + shared 1)に、51B の N-gram Embedding と 4B の MTP 層を加えた構成です。N-gram Embedding は bigram / trigram をインデックスに使う埋め込みで、MoE より計算を要さずオフロードしやすい軸でパラメータを積み増しています。重みは Hugging Face で Qwen Community License 1.0 として公開されています。
Gated DeltaNet と Qwen Sparse Attention のハイブリッド
48 層を「3 × (Gated DeltaNet → MoE) → 1 × (Qwen Sparse Attention → MoE)」の 12 ブロックで構成しています。Qwen Sparse Attention(QSA)はトークン単位ではなくマイクロブロック単位で注意対象を選ぶ疎な注意機構で、長いコンテキストでの遅延を抑えることを狙っています。残差ストリームにはデータ依存の読み書きゲートを持つ Gated Residual が入り、深い層でも学習を安定させる設計です。
画像・動画入力に対応
ビジョンエンコーダを備えたマルチモーダルモデルで、静止画と動画の両方を入力できます。HAI 経由の実リクエストで画像(64×64 PNG)と動画(約 2 分の MP4)に応答することを確認済みです。動画入力に対応するモデルは qwen3.8-27b / gemma-4-31b-it / qwen3.6-35b-a3b / glm-5.3-flash に続く 5 本目です。
ベンチマーク(Qwen 公表値)
Qwen はモデルカードでスコアを公表しています。同世代の dense モデル Qwen3.8 27B との比較では、DeepSWE 1.1 が 42.2 から 58.7、SWE-bench Multilingual が 73.8 から 81.0 と、エージェント的なコーディングで差が大きく開いています。
| ベンチマーク | Flash Next | Qwen3.8 27B | DeepSeek V4 Flash 0731 | Claude Opus 4.6 (Max) |
|---|---|---|---|---|
| SWE-bench Pro | 62.5 | 61.7 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | — | 77.5 |
| DeepSWE 1.1 | 58.7 | 42.2 | 54.4 | — |
| NL2Repo-Bench | 48.1 | 42.3 | 54.2 | 47.6 |
| Toolathlon Verified | 73.5 | 67.1 | 70.3 | — |
| IFBench | 81.3 | 79.5 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 89.2 | 90.8 | 91.3 |
| LiveCodeBench v6 | 91.9 | 90.3 | 90.6 | 88.8 |
| HLE | 35.9 | 30.8 | 33.8 | 40.0 |
SWE-bench Pro・DeepSWE 1.1・Toolathlon Verified・IFBench・GPQA Diamond・LiveCodeBench v6 では、表にある他の 3 モデルをすべて上回っています。一方で NL2Repo-Bench は DeepSeek V4 Flash 0731 の 54.2 に届かず、HLE は Claude Opus 4.6 の 40.0 に届いていません。
測定条件は thinking 有効、temperature = 1.0 / top_p = 0.95、コンテキスト 256K です。DeepSWE 1.1 は Claude Code と mini-SWE-agent の 2 つの harness のうち高い方、SWE-bench Pro は Claude Code harness(Claude Opus 4.6 のみ公表値)、SWE-bench Multilingual は mini-SWE-agent harness で測定されています。いずれも Qwen 自身による測定で、第三者の独立評価ではありません。
使い方
model に qwen3.8-flash-next を指定します。
curl https://hai-api.hcloud.ltd/v1/chat/completions \
-H "Authorization: Bearer hai_..." \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-flash-next",
"messages": [{"role":"user","content":"このリポジトリの構成を説明してください"}]
}'
Claude Code から使う場合は環境変数を差し替えてください。
export ANTHROPIC_BASE_URL=https://hai-api.hcloud.ltd
export ANTHROPIC_AUTH_TOKEN=hai_...
export ANTHROPIC_MODEL=qwen3.8-flash-next
export ANTHROPIC_SMALL_FAST_MODEL=qwen3.8-flash-next
claude
このモデル自体が低価格帯なので、バックグラウンドタスク用の ANTHROPIC_SMALL_FAST_MODEL にも同じモデルを指定して構いません。
注意点
- コンテキストは 262,144 トークンです。 モデルカードの native 値と同じですが、Alibaba の商用 API が 1M トークンを既定にしているのと違い、HAI では 262,144 で提供します。入力がこれを超えると 400(
context_length_exceeded)を返します。1M クラスの入力が必要ならdeepseek-v4.1-flash/glm-5.3-flash/kimi-k3を使ってください - 既定で思考(thinking)が有効です。
reasoning_effortはnone/minimal/low/medium/high/xhighの 6 値すべてを受け付けます。思考トークンは出力として課金されるため(思考パラメータのお知らせ)、単純な問い合わせでも出力トークンが増えます - プレフィックスキャッシュに対応し、キャッシュから供給された入力は ¥5(1M tok・税込表示)で課金します。キャッシュは 1,024 トークン単位で効くため、それより短いプレフィックスでは割引が出ません
- 出力はテキストのみです。画像・動画は入力にのみ使えます
- 1 リクエストあたりの出力上限は 128,000 トークンです
- HAI Go / HAI Go Plus の定額対象には含まれません。従量課金(クレジット)でのご利用になります