定額プランの同時実行枠が解放されず 429 が続く問題を修正しました
HAI Go / HAI Go Plus で qwen3.8-27b-uncensored などのモデルをご利用の際、実際には処理中のリクエストが無いのに 同時実行数の上限に達したものとして 429 が返り続ける問題がありました。2026 年 9 月 21 日に原因を特定し、修正済みです。ご不便をおかけし申し訳ありません。
症状
- 進行中のリクエストが無いのに
429で失敗する messageはConcurrent request limit reached: HAI Go allows up to 1 concurrent request per model. …- 再送しても最長 1 時間ほど解消しない。他のモデルは問題なく使える
{
"error": {
"type": "rate_limit_error",
"message": "Concurrent request limit reached: HAI Go allows up to 1 concurrent request per model. Wait for an in-flight request to finish, then retry."
}
}
影響範囲
2026 年 9 月 20 日から 9 月 21 日の間に、HAI Go / HAI Go Plus でストリーミング(stream: true)でご利用いただいた一部のお客様。前払いチャージ(従量)のご利用には同時実行枠の本数制限が無いため、影響はありません。
原因
定額プランには、他のお客様と平等にご利用いただくために、モデルごとの同時実行枠(HAI Go は 1 本、HAI Go Plus は 2 本)を 9 月 20 日から設けています。リクエストの受付時に枠を確保し、応答が終わった時点で解放する仕組みです。
ストリーミングでは、長い入力の処理中(応答の最初のトークンが返るまでの間)にクライアント側で接続が切れることがあります。この場合、当社側の処理は応答を待ち続け、応答が届いた後に本来行うべき枠の解放に到達していませんでした。枠は安全のため最長 1 時間で自動的に戻る設計でしたが、その 1 時間の間、同じアカウントからの同じモデルへのリクエストは、進行中のものが無くても上限に達したものとして扱われていました。
対応
| 項目 | 変更前 | 変更後 |
|---|---|---|
| 接続が切れたときの枠の解放 | 応答完了時のみ | 接続が切れた時点で即時 |
| 接続が切れたときの推論処理 | 継続 | 中断を基盤へ伝達 |
| 枠が戻るまでの最長時間 | 最長 1 時間 | 30 秒以内 |
課金への影響
この問題で 429 になったリクエストは処理を行っていないため、課金・利用枠の消費はありません。接続が切れたリクエストについても、応答をお受け取りいただいていない分は課金していません。
同時実行枠の数え方について
あわせて、料金ページ と ドキュメント に、同時実行枠が アカウント単位 であることを明記しました。お持ちのすべての API キー・すべての環境からのリクエストを合算して、モデルごとに数えます。複数の環境から同時に同じモデルをご利用の場合は、合計が枠の本数に収まるようにしてください。
お客様側の対応
不要です。設定・API キー・モデル ID の変更はありません。現在 429 が続いている場合は、修正の反映により解消しています。