リリース

Qwen4 系アーキテクチャの先行版 Qwen3.8 Flash Next を追加しました

qwen3.8-flash-next を追加しました。Alibaba の Qwen チームが 2026 年 8 月に公開した、次世代 Qwen4 の基盤となるアーキテクチャを先行して採用したオープンウェイトモデルです。単価は入力 ¥30 / 出力 ¥95(1M tok・税込表示)で、カタログ最安帯の glm-5.3-flash(入力 ¥30 / 出力 ¥100)とほぼ同じ価格帯です。

既存の Qwen3.8 27B(qwen3.8-27b)とは別のモデルとして追加しています。27B は dense、Flash Next は 125B/6B の MoE で、同じ Qwen3.8 世代でも構造が違います。ベンチマーク上は多くの指標で 27B を上回っており、コーディングエージェントやマルチモーダルのワークロードをより低い単価で回したいときの選択肢になります。

特徴

125B/6B の MoE に 51B の N-gram Embedding を重ねる

総パラメータ 125B・アクティブ 6B の Mixture-of-Experts(512 experts、routed 10 + shared 1)に、51B の N-gram Embedding と 4B の MTP 層を加えた構成です。N-gram Embedding は bigram / trigram をインデックスに使う埋め込みで、MoE より計算を要さずオフロードしやすい軸でパラメータを積み増しています。重みは Hugging Face で Qwen Community License 1.0 として公開されています。

Gated DeltaNet と Qwen Sparse Attention のハイブリッド

48 層を「3 × (Gated DeltaNet → MoE) → 1 × (Qwen Sparse Attention → MoE)」の 12 ブロックで構成しています。Qwen Sparse Attention(QSA)はトークン単位ではなくマイクロブロック単位で注意対象を選ぶ疎な注意機構で、長いコンテキストでの遅延を抑えることを狙っています。残差ストリームにはデータ依存の読み書きゲートを持つ Gated Residual が入り、深い層でも学習を安定させる設計です。

画像・動画入力に対応

ビジョンエンコーダを備えたマルチモーダルモデルで、静止画と動画の両方を入力できます。HAI 経由の実リクエストで画像(64×64 PNG)と動画(約 2 分の MP4)に応答することを確認済みです。動画入力に対応するモデルは qwen3.8-27b / gemma-4-31b-it / qwen3.6-35b-a3b / glm-5.3-flash に続く 5 本目です。

ベンチマーク(Qwen 公表値)

Qwen はモデルカードでスコアを公表しています。同世代の dense モデル Qwen3.8 27B との比較では、DeepSWE 1.1 が 42.2 から 58.7、SWE-bench Multilingual が 73.8 から 81.0 と、エージェント的なコーディングで差が大きく開いています。

Qwen3.8 Flash Next と Qwen3.8 27B のベンチマーク比較。SWE-bench Pro が 62.5 対 61.7、SWE-bench Multilingual が 81.0 対 73.8、DeepSWE 1.1 が 58.7 対 42.2、Toolathlon Verified が 73.5 対 67.1、IFBench が 81.3 対 79.5、GPQA Diamond が 91.7 対 89.2、LiveCodeBench v6 が 91.9 対 90.3、HLE が 35.9 対 30.8

ベンチマークFlash NextQwen3.8 27BDeepSeek V4 Flash 0731Claude Opus 4.6 (Max)
SWE-bench Pro62.561.756.053.4
SWE-bench Multilingual81.073.8—77.5
DeepSWE 1.158.742.254.4—
NL2Repo-Bench48.142.354.247.6
Toolathlon Verified73.567.170.3—
IFBench81.379.579.262.5
GPQA Diamond91.789.290.891.3
LiveCodeBench v691.990.390.688.8
HLE35.930.833.840.0

SWE-bench Pro・DeepSWE 1.1・Toolathlon Verified・IFBench・GPQA Diamond・LiveCodeBench v6 では、表にある他の 3 モデルをすべて上回っています。一方で NL2Repo-Bench は DeepSeek V4 Flash 0731 の 54.2 に届かず、HLE は Claude Opus 4.6 の 40.0 に届いていません。

測定条件は thinking 有効、temperature = 1.0 / top_p = 0.95、コンテキスト 256K です。DeepSWE 1.1 は Claude Code と mini-SWE-agent の 2 つの harness のうち高い方、SWE-bench Pro は Claude Code harness(Claude Opus 4.6 のみ公表値)、SWE-bench Multilingual は mini-SWE-agent harness で測定されています。いずれも Qwen 自身による測定で、第三者の独立評価ではありません。

使い方

model に qwen3.8-flash-next を指定します。

curl https://hai-api.hcloud.ltd/v1/chat/completions \
  -H "Authorization: Bearer hai_..." \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-flash-next",
    "messages": [{"role":"user","content":"このリポジトリの構成を説明してください"}]
  }'

Claude Code から使う場合は環境変数を差し替えてください。

export ANTHROPIC_BASE_URL=https://hai-api.hcloud.ltd
export ANTHROPIC_AUTH_TOKEN=hai_...
export ANTHROPIC_MODEL=qwen3.8-flash-next
export ANTHROPIC_SMALL_FAST_MODEL=qwen3.8-flash-next
claude

このモデル自体が低価格帯なので、バックグラウンドタスク用の ANTHROPIC_SMALL_FAST_MODEL にも同じモデルを指定して構いません。

注意点

単価とモデル一覧は料金ページ、モデル ID とセットアップ手順はドキュメントに掲載しています。

← 新着情報一覧へ

今日から、baseURL を差し替えるだけ。

コンソールを開く