HAI は国内企業向けの Inference API です。ゼロデータ保持(ZDR)方針と、モデルに応じた推論基盤(自社保有 GPU と TEE を用いた分散 GPU)のもとで、OpenAI SDK のまま baseURL を差し替えるだけで使えます。Claude Code や Codex もそのまま使えます。
初回チャージ特典 — 初めてのチャージのときに、チャージ額の 10% 分のクレジットを追加で発行します(上限 ¥500)。¥5,000 のチャージで ¥5,500 分(1 アカウント 1 回限り)。
from openai import OpenAI client = OpenAI( base_url="https://hai-api.hcloud.ltd/v1", api_key="hai_...", ) r = client.chat.completions.create( model="deepseek-v4-flash", messages=[{"role":"user","content":"こんにちは"}], ) print(r.choices[0].message.content)
フルモデル(Kimi K3 / Kimi K2.6 / DeepSeek V4)は コンソール から。
データの扱い、運用体制、インフラ。LLM を業務で使うために欠かせない 3 点を、HAI はサービス設計の前提として約束します。
国内事業者による運用体制。契約・請求・サポートを日本語で完結できます。
プロンプト・生成本文は保存しません。利用ログはトークン数と料金メタデータのみです。
コード変更ゼロで Claude Code / Codex の通信先を HAI に切り替えられます。プロンプト本文は保存せず、学習にも使いません。
export ANTHROPIC_BASE_URL=https://hai-api.hcloud.ltd export ANTHROPIC_AUTH_TOKEN=hai_... export ANTHROPIC_MODEL=kimi-k2.6 export ANTHROPIC_SMALL_FAST_MODEL=deepseek-v4-flash claude
model_provider = "hai" model = "kimi-k2.6" [model_providers.hai] name = "HAI" base_url = "https://hai-api.hcloud.ltd/v1" env_key = "HAI_API_KEY" wire_api = "responses"
1M コンテキストが必要な場合は kimi-k3(TEE を用いた分散 GPU 基盤)も利用できます。
第三者機関 Artificial Analysis の評価では、HAI が提供する GLM-5.3 は Intelligence Index 45 で、重みが公開されたモデルの中で 1 位です。重みが公開されたモデルなので当社の設備で動かせます。だから国内で完結し、データを保持しません。
glm-5.3
Artificial Analysis の LLM リーダーボードで、GLM-5.3 は Intelligence Index 45。重みが公開されたモデルの中では 1 位です。上位の Claude Fable 5.1(53)や GPT-6 Astra(53)とは 8 ポイント差です。
deepseek-v4.1-flash
DeepSeek V4.1 Flash は Intelligence Index 40 で、Claude Opus 5 (low) と同点です。同じ 1 タスクを実行したときのコストは、HAI の公開単価で約 1/3 になります。
| モデル | Intelligence Index | Cost per Task |
|---|---|---|
| Claude Fable 5.1 (xhigh with fallback) | 53 | ¥897 |
| GPT-6 Astra (xhigh) | 53 | ¥347 |
| Claude Opus 5 (max) | 51 | ¥879 |
| GPT-5.6 Sol (max) | 47 | ¥299 |
| GLM-5.3 glm-5.3 | 45 | ¥401 |
| Kimi K3 kimi-k3 | 44 | ¥389 |
| Gemini 3.8 Flash (high) | 41 | ¥186 |
| Claude Opus 5 (low) | 40 | ¥165 |
| Qwen3.8 2.4T-A95B qwen3.8-2.4t-a95b | 40 | ¥461 |
| DeepSeek V4.1 Flash deepseek-v4.1-flash | 40 | ¥53 |
| Gemini 3.7 Flash (high) | 39 | ¥140 |
| Claude Sonnet 5 (max) | 38 | ¥764 |
| GPT-5.6 Luna (max) | 38 | ¥27 |
| DeepSeek V4 Flash deepseek-v4-flash | 35 | ¥16 |
| Gemini 3.6 Flash | 34 | ¥140 |
出典: Artificial Analysis LLM Leaderboard(2026-09-12 取得、Intelligence Index v4.3)。
掲載行は Anthropic / OpenAI / Google の各モデルを最高性能設定で 1 行ずつ、Intelligence Index の降順に 34 まで並べたものです。同一 Index のときは Cost per Task が低い方を採っています。
HAI 以外の Cost per Task は Artificial Analysis の公表値(各社の公表価格に基づく測定)で、1 USD = ¥150(2026-09-12 時点)で円に換算しています。HAI の料金は円建て固定のため、為替の変動を受けません。
HAI の Cost per Task は当社算出です。Intelligence Index を 1 タスク実行するのに要するトークン数(GLM-5.3: 入力 1,209,054 / 出力 71,128、Kimi K3: 入力 424,435 / 出力 48,455、Qwen3.8 2.4T-A95B: 入力 872,050 / 出力 68,515、DeepSeek V4.1 Flash: 入力 529,788 / 出力 88,574、DeepSeek V4 Flash: 入力 313,030 / 出力 62,054)に、当社の公開単価を適用しています。
ベンチマークのスコアは実際の業務での性能を保証するものではありません。単価とモデル一覧は料金ページに掲載しています。
固定の円建て単価。チャージ制(¥1,000〜
¥5,000 のチャージで ¥5,500 分のクレジット
初めてのチャージのときに、チャージ額の 10% 分のクレジットを追加で発行します(上限 ¥500)。1 アカウント 1 回限りです。
法人向け年額前払い。¥300,000 から
請求書払いで年額を前払いすると、有償額の 10% 分を増量して発行します。 前半は入金時、後半は 6 ヶ月後に自動発行。個人と同じ API・同じ単価です。法人向けのご案内
| モデル | 入力 / 1M tok | キャッシュ読取 / 1M tok | 出力 / 1M tok | コンテキスト | tok/s |
|---|---|---|---|---|---|
| Kimi K3TEE kimi-k3 | ¥585 | ¥85 | ¥2,910 | 1,048,576 | 30 |
| Qwen3.8 2.4T-A95BTEE qwen3.8-2.4t-a95b | ¥430 | ¥60 | ¥1,250 | 262,144 | 49 |
| GLM-5.3自社DC glm-5.3 | ¥280 | ¥55 | ¥880 | 1,048,576 | 30 |
| Kimi K2.6自社DC kimi-k2.6 | ¥160 | ¥35 | ¥730 | 262,144 | 30 |
| Qwen3.8 27B自社DC qwen3.8-27b | ¥90 | — | ¥640 | 262,144 | 30 |
| Qwen3.8 27B Uncensored自社DC qwen3.8-27b-uncensored | ¥70 | — | ¥700 | 245,760 | 52 |
| DeepSeek V4.1 Flash自社DC deepseek-v4.1-flash | ¥60 | ¥5 | ¥240 | 1,048,576 | 111 |
| Gemma 4 31B自社DC gemma-4-31b-it | ¥55 | — | ¥125 | 262,144 | 95 |
| LLM-jp-4-VL 9B自社DC llm-jp-4-vl-9b | ¥55 | — | ¥125 | 32,768 | 30 |
| Qwen3.6 35B-A3B自社DC qwen3.6-35b-a3b | ¥35 | — | ¥230 | 262,144 | 30 |
| DeepSeek V4 Flash自社DC deepseek-v4-flash | ¥35 | ¥10 | ¥75 | 1,048,576 | 85 |
| GLM-5.3 Flash自社DC glm-5.3-flash | ¥30 | ¥10 | ¥100 | 1,048,576 | 59 |
| モデル | 入力 / 1M tok | 次元 | コンテキスト |
|---|---|---|---|
| Qwen3 Embedding 8B自社DC qwen3-embedding-8b | ¥10 | 4,096 | 32,000 |
| モデル | ¥/秒 | 参照画像 ¥/枚 | 長さ |
|---|---|---|---|
| MiniMax H3自社DC minimax-h3 | ¥30 | ¥10 | 5〜15 秒 |
埋め込みは /v1/embeddings、動画生成は /v1/videos です(どちらもテキスト生成の GET /v1/models には含まれません)。tok/s は直近 24 時間の出力速度の中央値です。
掲載してほしいモデルがあれば教えてください。ご意見箱扱いとなるため、こちらでは返信いたしません。
モデルをリクエストするkimi-k3 と qwen3.8-2.4t-a95b の推論は、TEE(Trusted Execution Environment / 信頼実行環境)を用いた分散 GPU 基盤で実行します。他のモデルは自社で保有・運用する GPU で実行します。
この 2 つは混同されがちですが、担っている仕組みが違います。
HAI 側の実装で担保します。利用ログに記録するのはモデル名・トークン数・料金・レイテンシ・API キー識別子だけで、本文は含みません。
TEE が担います。処理している最中のデータを、基盤を動かしている側から読み出せないようにする仕組みです。
通常のサーバーでは、アプリケーションが扱っているデータは、そのサーバーに強い権限を持つ人から見えます。OS の管理者、仮想化基盤の管理者、データセンターで機器に物理的に触れる人です。ディスクを暗号化していても、処理している最中のデータはメモリ上に平文で存在するためです。
TEE はこの前提を変えます。CPU や GPU のハードウェア自体に、特定の領域のメモリを暗号化し、その鍵をハードウェアの内側に閉じ込める機能を持たせます。鍵はソフトウェアから取り出せません。結果として次のようになります。
GPU の機密計算(Confidential Computing)機能を利用しており、GPU メモリがホスト側から切り離され、CPU と GPU の間を流れるデータも暗号化されます。モデルの重み、入力したテキスト、生成中のテキストは、いずれも暗号化された領域の内側だけに存在します。
kimi-k3(100 万トークンのコンテキスト)と qwen3.8-2.4t-a95b(総パラメータ 2.4 兆)は、いずれも 1 台のノードには収まらない大規模モデルのため、複数のノードに分割して実行します。ノードの間を流れる中間データも暗号化して転送します。
TEE の内側は実行ノードです。当該ノードでは、リクエストを受け付けるアプリケーションを含めて TEE の内側で処理されます。ノードを運用する事業者は、処理中のプロンプトや生成結果を読み出せない構成です。
一方、HAI 自身のサーバーは TEE の外にあります。モデル ID の検証、トークン数の計測と課金、レスポンスの検査を行うために本文を処理する必要があるためです。この層で本文を保存しないことは、当社のコードで担保しています。