リリース
qwen3.8-27b-uncensored の推論基盤を増強しました
qwen3.8-27b-uncensored の推論基盤に GPU を追加しました。モデル ID・エンドポイント・単価・コンテキスト長はいずれも変わりません。リクエスト側の変更も不要です。
このモデルは自社設備の GPU だけで提供しているため、設備が埋まっている間は順番待ちになります。今回の増強は、その順番待ちが起きる頻度を下げるためのものです。
変更点
| 項目 | 変更前 | 変更後 |
|---|---|---|
| 同時実行枠 | 標準 | 拡大 |
| 単価 | 入力 ¥70 / 出力 ¥700 | 据え置き |
| コンテキスト | 256K(262,144)tok | 据え置き |
同時実行枠は前払いチャージ(従量)・HAI Go・HAI Go Plus のいずれでも広がります。プランごとの枠の差はこれまでどおりで、今回その関係は変えていません。
長い入力も対象です
今回追加した GPU は、長い入力のリクエストも受けられる構成にしています。短いプロンプトを繰り返す使い方だけでなく、長い会話履歴やファイル群をコンテキストに載せる使い方でも増強分を使えます。
リクエストの振り分けは基盤側で自動的に行います。リクエスト側で指定する必要はありません。公開しているコンテキスト長は 256K(262,144)トークンのままです。
生成速度そのものは変わりません
今回広げたのは設備の総量です。1 回のリクエストが返ってくるまでの速度を上げる変更ではありません。
これまでどおり、混雑している時間帯は生成速度が落ちます。今回の増強で、その状態になるまでの余裕が広がりました。
変わらないもの
- モデル ID・エンドポイント・API キーはそのままです
- 全モデルの公開単価に変更はありません
- コンテキスト長・対応パラメータ・画像入力の扱いに変更はありません
- HAI Go / HAI Go Plus の対象モデル・月額・利用枠に変更はありません
- 過去のリクエスト・ご利用明細への影響はありません
- 旧 ID
qwen3.6-35b-a3b-uncensoredの読み替えはこれまでどおり有効です
注意点
- 混雑時に順番待ちが発生する可能性そのものは残ります。 設備は増えましたが、「優先処理」や「待たされない」をお約束するものではありません
- 順番待ちの上限はストリーミングのほうが長いため、エージェント用途では
stream: trueを推奨します(詳細) - 設備の構成は今後も混雑状況に応じて調整します