モデルの追加、API の拡張、メンテナンスのお知らせを掲載します。
定額プラン HAI Go・HAI Go Plus の対象モデルに deepseek-v4.1-flash を追加しました。月間利用枠と短期枠のあるモデルで、モデル ID・単価・API の使い方に変更はありません。
DeepSeek のネイティブマルチモーダルモデル deepseek-v4.1-flash を追加しました。入力 ¥60 / 出力 ¥240(1M tok・税込表示)、コンテキスト 1M トークン、画像入力に対応します。
会話が長くなると 400 Invalid request が続き、新規セッションでは直る問題がありました。9 月 8 日に修正済みです。公開コンテキスト長を 245,760 トークンに改め、出力上限の超過は上限に丸めます。長い入力が間欠的に失敗する 2 件も修正しました。失敗分は課金されていません。
モデル一覧に載っている model_id なのに、404 Not found で失敗することがありました。9 月 6 日に修正済みです。自動で再送するようにし、それでも応じられない場合は 503 で返します。リクエスト側の変更は不要で、失敗分は課金されていません。
特定の書式チェックを含むツール定義を送ると 400 エラーになっていました。9 月 5 日に修正済みです。リクエスト側の変更は不要で、失敗分は課金されていません。
qwen3.8-27b-uncensored に thinking を有効にしたリクエストを送ると、一部の GPU に当たったときだけ 400 エラーになっていました。9 月 5 日に修正済みです。リクエスト側の変更は不要で、失敗分は課金されていません。
出力上限に 1 や 2 を指定したリクエストが、当たった GPU によって 400 エラーになっていました。9 月 5 日に修正済みです。リクエスト側の変更は不要で、失敗分は課金されていません。
qwen3.8-27b-uncensored の推論基盤に GPU を追加し、混雑時の順番待ちが起きにくくなりました。長い入力を含むすべてのリクエストが対象です。モデル ID・単価・コンテキスト長に変更はありません。
qwen3.8-27b-uncensored に image_url で画像の URL を渡すと、一部の GPU に当たったときだけエラーになっていました。推論サーバーを入れ替えて解消しています。リクエスト側の変更は不要です。
推論ゲートウェイの負荷分散の不具合で、複数の GPU・経路に分散しているモデルで 1 つに処理が偏り、時間帯によって応答時間がばらついていました。修正済みで、qwen3.8-27b-uncensored では平均 39 秒から 19 秒に改善しています。
LLM-jp の日本語マルチモーダルモデル llm-jp-4-vl-9b を追加しました。入力 ¥55 / 出力 ¥125(1M tok・税込表示)、コンテキスト 32K トークン、画像入力に対応します。
有料推論(HAI Go / HAI Go Plus / クレジット)の毎分レート制限を、全プラン・全モデルで撤廃しました。混雑時の順番待ちと、一部モデルの短期枠・月間利用枠は従来どおりです。
定額プラン対象モデルのうち qwen3.8-27b-uncensored の月間利用枠を撤廃しました。より多くご利用いただけます。レート制限・混雑時の同時実行枠は引き続き適用されます。
埋め込み API `/v1/embeddings` の提供を開始し、qwen3-embedding-8b を追加しました。入力 ¥10(1M tok・税込表示)、コンテキスト 32,000 トークン、4,096 次元です。
月額 ¥4,980(税込)の HAI Go Plus を開始しました。対象モデルは HAI Go と同じまま、利用枠と混雑時の同時実行枠を広げています。コンソールから即時に切り替えられます。
Codex CLI から qwen3.8-27b-uncensored に画像を読み込ませると、Viewed Image の直後に Invalid request となっていました。Responses API 側で修正しています。設定の変更は不要です。
Z.ai のフラッグシップモデル glm-5.3 を追加しました。入力 ¥280 / 出力 ¥880(1M tok・税込表示)、コンテキスト 1M トークン、キャッシュ読み出しは ¥55 です。
通常帯と深夜帯の区別をやめ、毎分 20 リクエストまでの一律制限にしました。混雑時は 429 で切らず順番待ちします(stream は最大 4 分)。毎分の制限はその後撤廃しました。
Z.ai の native マルチモーダルモデル glm-5.3-flash を追加しました。入力 ¥30 / 出力 ¥100(1M tok・税込表示)、コンテキスト 1M トークン、画像・動画入力に対応します。
qwen3.8-27b-uncensored の推論基盤を 8bit 量子化に更新済みでしたが、ドキュメントの精度列が INT4 のままでした。表記を FP8 に修正しました。モデル ID・単価・コンテキスト長に変更はありません。
推論基盤のプレフィックスキャッシュを有効にしました。qwen3.8-27b-uncensored に約 2.8 万トークンの同じプロンプトを送り直したとき、応答完了まで 19.05 秒から 0.91 秒になりました。単価とモデル ID に変更はありません。
応答開始まで 125 秒を超えるリクエストが、経路上の CDN によって切断されていました。API ドメインを CDN 非経由に変更して解消しています。ホスト名・エンドポイント・API キーの変更は不要です。
推論リクエストの振り分けを見直し、混雑時の待ち時間を短縮しました。qwen3.8-27b-uncensored に 10 万トークンを渡した場合の応答開始まで(TTFT)は p50 23 秒から 3 秒になりました。単価とモデル ID に変更はありません。
月額 ¥1,980(税込)で qwen3.8-27b-uncensored・gemma-4-31b-it・deepseek-v4-flash を定額でご利用いただける「HAI Go」を開始しました。制限はその後変更しています(本文の追記と料金ページをご覧ください)。
掲載してほしいモデルを気軽に送れるご意見箱を開きました。ご意見箱扱いとなるため、こちらでは返信いたしません。品揃えはユーザーの声で決めます。
qwen3.8-27b-uncensored の推論基盤を増強し、コンテキストを 64K から 256K に拡大しました。応答開始までの時間も短縮し、画像入力に再対応しました。単価は入力 ¥70 / 出力 ¥700(1M tok・税込表示)で据え置きです。
qwen3.8-27b-uncensored を入力 ¥70 / 出力 ¥700(1M tok・税込表示)に改定しました。入力 +40%、出力 +118.75% の値上げです。本記事の公開時点以降のリクエストに適用されます。他のモデルは変更ありません。
初回チャージ特典を定額 +¥500 からチャージ額の 10%(上限 ¥500)に改定しました。¥5,000 以上は従来どおり +¥500、¥1,000 は +¥100 です。発行済みの特典分は減額しません。
qwen3.8-27b-uncensored は reasoning_effort の "high" を受け付けずエラーになります。指定できるのは "xhigh" / "medium" / "low" です。Claude Code の budget_tokens にも上限があります。他のモデルは影響ありません。
qwen3.6-35b-a3b-uncensored を qwen3.8-27b-uncensored に入れ替えました。入力 ¥50 / 出力 ¥320(1M tok・税込表示)、コンテキスト 64K トークンは据え置きです。旧 ID は自動で切り替わりますが、入力はテキストのみになり画像は渡せなくなります。
4 モデルにキャッシュ読取単価を追加し、全モデルの入力/出力単価を見直しました。本記事の公開時点以降のリクエストから新しい単価が適用されます。
Qwen の 27B dense マルチモーダルモデル qwen3.8-27b を追加しました。入力 ¥90 / 出力 ¥640(1M tok・税込表示)、コンテキスト 256K トークン、画像・動画入力と思考の ON / OFF に対応します。
Qwen の 2.4 兆パラメータ MoE モデル qwen3.8-2.4t-a95b を追加しました。入力 ¥435 / 出力 ¥1,220(1M tok・税込表示)、コンテキスト 256K トークン、TEE を用いた分散 GPU 基盤で実行します。
提供中の全モデルの公開単価を引き下げました。deepseek-v4-flash は入力 ¥30 / 出力 ¥60(1M tok・税込表示)、動画は ¥30/秒です。紹介プログラムの確定条件は累計 ¥6,500 に改定しました。
チャージ時に +¥500 分のクレジットを追加発行する特典を開始しました。1 アカウント 1 回限り。利用規約 §3(クレジット)もあわせて改定しています。
Qwen3.6-35B-A3B の無検閲派生 qwen3.6-35b-a3b-uncensored を追加しました。入力 ¥60 / 出力 ¥400(1M tok・税込表示)、コンテキスト 64K トークン、テキスト・画像入力に対応します。
Alibaba Qwen の 35B/3B MoE モデル qwen3.6-35b-a3b を追加しました。入力 ¥45 / 出力 ¥310(1M tok・税込表示)、コンテキスト 256K トークン、テキスト・画像・動画入力に対応します。
MiniMax の動画生成モデル minimax-h3 を /v1/videos で提供します。2K・音声付き・5〜15 秒、¥35/秒(税込表示)。参照画像は ¥10/枚です。
Google DeepMind の 30.7B マルチモーダルモデル gemma-4-31b-it を追加しました。入力 ¥60 / 出力 ¥145(1M tok・税込表示)、コンテキスト 256K トークン、HAI で初めて動画入力に対応します。
Moonshot AI の汎用マルチモーダルモデル kimi-k2.6 を追加しました。入力 ¥205 / 出力 ¥915(1M tok・税込表示)、コンテキスト 256K トークン、画像入力に対応し、思考を OFF にできます。
本日 10:11–20:02(JST)、推論ゲートウェイの高負荷により API が不安定でした。現在は復旧済みです。ご迷惑をおかけし申し訳ありません。
model_id は deepseek-v4-flash のまま、自動的に 0731 スナップショットへルーティングされます。価格は据え置きで、エージェント系ベンチマークが大幅に向上しました。
登録もクレジットカードも不要でキーを発行できるようになりました。ドキュメントのボタンから発行して、そのまま API を試せます。
思考量の指定をモデルへ透過するようにしました。思考の内容と使用トークン数が各 API のレスポンスに含まれます。
/v1/messages を追加しました。Claude Code は環境変数を差し替えるだけで、コード変更なしに HAI のモデルを利用できます。