OpenAI / Anthropic API 互換

国内で安全に、
LLM を本番へ。

HAI は国内企業向けの Inference API です。ゼロデータ保持(ZDR)方針と、モデルに応じた推論基盤(自社保有 GPU と TEE を用いた分散 GPU)のもとで、OpenAI SDK のまま baseURL を差し替えるだけで使えます。Claude Code や Codex もそのまま使えます。

初回チャージ特典 — 初めてのチャージのときに、チャージ額の 10% 分のクレジットを追加で発行します(上限 ¥500)。¥5,000 のチャージで ¥5,500 分(1 アカウント 1 回限り)。

Quick start
from openai import OpenAI

client = OpenAI(
  base_url="https://hai-api.hcloud.ltd/v1",
  api_key="hai_...",
)

r = client.chat.completions.create(
  model="deepseek-v4-flash",
  messages=[{"role":"user","content":"こんにちは"}],
)
print(r.choices[0].message.content)

フルモデル(Kimi K3 / Kimi K2.6 / DeepSeek V4)は コンソール から。

3つの約束

データの扱い、運用体制、インフラ。LLM を業務で使うために欠かせない 3 点を、HAI はサービス設計の前提として約束します。

JP

国内で安全

国内事業者による運用体制。契約・請求・サポートを日本語で完結できます。

ZDR

ゼロデータ保持

プロンプト・生成本文は保存しません。利用ログはトークン数と料金メタデータのみです。

GPU

推論基盤

モデルにより 2 種類の基盤を使い分けます。自社保有 GPU と、TEE を用いた分散 GPUです。

AI コーディングツールを、国内 API で

コード変更ゼロで Claude Code / Codex の通信先を HAI に切り替えられます。プロンプト本文は保存せず、学習にも使いません。

Claude Code
export ANTHROPIC_BASE_URL=https://hai-api.hcloud.ltd
export ANTHROPIC_AUTH_TOKEN=hai_...
export ANTHROPIC_MODEL=kimi-k2.6
export ANTHROPIC_SMALL_FAST_MODEL=deepseek-v4-flash
claude
Codex — ~/.codex/config.toml
model_provider = "hai"
model = "kimi-k2.6"

[model_providers.hai]
name = "HAI"
base_url = "https://hai-api.hcloud.ltd/v1"
env_key = "HAI_API_KEY"
wire_api = "responses"

1M コンテキストが必要な場合は kimi-k3TEE を用いた分散 GPU 基盤)も利用できます。

設定ファイルを生成するセットアップ手順を見る

第三者評価 · Artificial Analysis

Claude・GPT との比較

第三者機関 Artificial Analysis の評価では、HAI が提供する GLM-5.3 は Intelligence Index 45 で、重みが公開されたモデルの中で 1 位です。重みが公開されたモデルなので当社の設備で動かせます。だから国内で完結し、データを保持しません。

オープンウェイト首位

glm-5.3

Artificial Analysis の LLM リーダーボードで、GLM-5.3 は Intelligence Index 45。重みが公開されたモデルの中では 1 位です。上位の Claude Fable 5.1(53)や GPT-6 Astra(53)とは 8 ポイント差です。

約 1/3 のコスト

deepseek-v4.1-flash

DeepSeek V4.1 Flash は Intelligence Index 40 で、Claude Opus 5 (low) と同点です。同じ 1 タスクを実行したときのコストは、HAI の公開単価で約 1/3 になります。

モデルIntelligence IndexCost per Task
Claude Fable 5.1 (xhigh with fallback)53¥897
GPT-6 Astra (xhigh)53¥347
Claude Opus 5 (max)51¥879
GPT-5.6 Sol (max)47¥299
GLM-5.3
glm-5.3
45¥401
Kimi K3
kimi-k3
44¥389
Gemini 3.8 Flash (high)41¥186
Claude Opus 5 (low)40¥165
Qwen3.8 2.4T-A95B
qwen3.8-2.4t-a95b
40¥461
DeepSeek V4.1 Flash
deepseek-v4.1-flash
40¥53
Gemini 3.7 Flash (high)39¥140
Claude Sonnet 5 (max)38¥764
GPT-5.6 Luna (max)38¥27
DeepSeek V4 Flash
deepseek-v4-flash
35¥16
Gemini 3.6 Flash34¥140

出典: Artificial Analysis LLM Leaderboard(2026-09-12 取得、Intelligence Index v4.3)。

掲載行は Anthropic / OpenAI / Google の各モデルを最高性能設定で 1 行ずつ、Intelligence Index の降順に 34 まで並べたものです。同一 Index のときは Cost per Task が低い方を採っています。

HAI 以外の Cost per Task は Artificial Analysis の公表値(各社の公表価格に基づく測定)で、1 USD = ¥150(2026-09-12 時点)で円に換算しています。HAI の料金は円建て固定のため、為替の変動を受けません。

HAI の Cost per Task は当社算出です。Intelligence Index を 1 タスク実行するのに要するトークン数(GLM-5.3: 入力 1,209,054 / 出力 71,128、Kimi K3: 入力 424,435 / 出力 48,455、Qwen3.8 2.4T-A95B: 入力 872,050 / 出力 68,515、DeepSeek V4.1 Flash: 入力 529,788 / 出力 88,574、DeepSeek V4 Flash: 入力 313,030 / 出力 62,054)に、当社の公開単価を適用しています。

ベンチマークのスコアは実際の業務での性能を保証するものではありません。単価とモデル一覧は料金ページに掲載しています。

モデルと料金

固定の円建て単価。チャージ制(¥1,000〜

+10%

¥5,000 のチャージで ¥5,500 分のクレジット

初回チャージ特典

初めてのチャージのときに、チャージ額の 10% 分のクレジットを追加で発行します(上限 ¥500)。1 アカウント 1 回限りです。

+10%

法人向け年額前払い。¥300,000 から

法人向け年額前払いコミット

請求書払いで年額を前払いすると、有償額の 10% 分を増量して発行します。 前半は入金時、後半は 6 ヶ月後に自動発行。個人と同じ API・同じ単価です。法人向けのご案内

テキスト生成

モデル入力 / 1M tokキャッシュ読取 / 1M tok出力 / 1M tokコンテキストtok/s
Kimi K3TEE
kimi-k3
¥585¥85¥2,9101,048,57630
Qwen3.8 2.4T-A95BTEE
qwen3.8-2.4t-a95b
¥430¥60¥1,250262,14449
GLM-5.3自社DC
glm-5.3
¥280¥55¥8801,048,57630
Kimi K2.6自社DC
kimi-k2.6
¥160¥35¥730262,14430
Qwen3.8 27B自社DC
qwen3.8-27b
¥90¥640262,14430
Qwen3.8 27B Uncensored自社DC
qwen3.8-27b-uncensored
¥70¥700245,76052
DeepSeek V4.1 Flash自社DC
deepseek-v4.1-flash
¥60¥5¥2401,048,576111
Gemma 4 31B自社DC
gemma-4-31b-it
¥55¥125262,14495
LLM-jp-4-VL 9B自社DC
llm-jp-4-vl-9b
¥55¥12532,76830
Qwen3.6 35B-A3B自社DC
qwen3.6-35b-a3b
¥35¥230262,14430
DeepSeek V4 Flash自社DC
deepseek-v4-flash
¥35¥10¥751,048,57685
GLM-5.3 Flash自社DC
glm-5.3-flash
¥30¥10¥1001,048,57659

埋め込み

モデル入力 / 1M tok次元コンテキスト
Qwen3 Embedding 8B自社DC
qwen3-embedding-8b
¥104,09632,000

動画生成

モデル¥/秒参照画像 ¥/枚長さ
MiniMax H3自社DC
minimax-h3
¥30¥105〜15 秒

埋め込みは /v1/embeddings、動画生成は /v1/videos です(どちらもテキスト生成の GET /v1/models には含まれません)。tok/s は直近 24 時間の出力速度の中央値です。

料金の詳細

掲載してほしいモデルがあれば教えてください。ご意見箱扱いとなるため、こちらでは返信いたしません。

モデルをリクエストする

TEE を用いた分散 GPU 基盤

kimi-k3qwen3.8-2.4t-a95b の推論は、TEE(Trusted Execution Environment / 信頼実行環境)を用いた分散 GPU 基盤で実行します。他のモデルは自社で保有・運用する GPU で実行します。

「保存しない」と「覗かれない」は別の仕組みです

この 2 つは混同されがちですが、担っている仕組みが違います。

ZDR

保存しない(ZDR)

HAI 側の実装で担保します。利用ログに記録するのはモデル名・トークン数・料金・レイテンシ・API キー識別子だけで、本文は含みません。

TEE

覗かれない

TEE が担います。処理している最中のデータを、基盤を動かしている側から読み出せないようにする仕組みです。

TEE とは何か

通常のサーバーでは、アプリケーションが扱っているデータは、そのサーバーに強い権限を持つ人から見えます。OS の管理者、仮想化基盤の管理者、データセンターで機器に物理的に触れる人です。ディスクを暗号化していても、処理している最中のデータはメモリ上に平文で存在するためです。

TEE はこの前提を変えます。CPU や GPU のハードウェア自体に、特定の領域のメモリを暗号化し、その鍵をハードウェアの内側に閉じ込める機能を持たせます。鍵はソフトウェアから取り出せません。結果として次のようになります。

  • メモリの中身は、OS の管理者にも仮想化基盤の管理者にも読めません
  • メモリモジュールを物理的に抜き取っても、暗号化されたデータしか得られません
  • デバッグ機能を使った覗き見も、ハードウェアが遮断します

GPU の場合

GPU の機密計算(Confidential Computing)機能を利用しており、GPU メモリがホスト側から切り離され、CPU と GPU の間を流れるデータも暗号化されます。モデルの重み、入力したテキスト、生成中のテキストは、いずれも暗号化された領域の内側だけに存在します。

複数ノードに分けて実行する場合

kimi-k3(100 万トークンのコンテキスト)と qwen3.8-2.4t-a95b(総パラメータ 2.4 兆)は、いずれも 1 台のノードには収まらない大規模モデルのため、複数のノードに分割して実行します。ノードの間を流れる中間データも暗号化して転送します。

どこまでが TEE の内側か

TEE の内側は実行ノードです。当該ノードでは、リクエストを受け付けるアプリケーションを含めて TEE の内側で処理されます。ノードを運用する事業者は、処理中のプロンプトや生成結果を読み出せない構成です。

一方、HAI 自身のサーバーは TEE の外にあります。モデル ID の検証、トークン数の計測と課金、レスポンスの検査を行うために本文を処理する必要があるためです。この層で本文を保存しないことは、当社のコードで担保しています。

新着情報

すべて見る

今日から、baseURL を差し替えるだけ。

コンソールを開く