OpenAI APIとは?GPT APIのモデル一覧・料金一覧をやさしく解説【2026年9月版】
OpenAI APIは、アプリや自分のプログラムからOpenAIのモデルを呼び出すための入口です。「GPT API」と呼ばれることもありますが、正式にはOpenAI APIで、GPTはその中で選ぶモデル群の名前です。
モデル名と料金表を先に見ると、APIは難しく見えます。実際に押さえることは、次の5つだけです。
- どのモデルを呼ぶか
- 入力と出力に何トークン使うか
- Responses APIなど、どのAPI形式を使うか
- モデルに渡すパラメータとリーズニング設定
- Web検索やファイル検索などのツールを使うか
トークンは、AIが文章を読むときの小さな区切りです。API料金は「何回呼んだか」だけでなく、どれだけの文章を渡し、どれだけ返してもらったかで決まります。タクシーでいえば、呼んだ回数だけでなく、走った距離と追加サービスに応じて支払うイメージです。
この記事では、2026年9月19日時点のOpenAI公式情報をもとに、現行モデルの全体像と料金の読み方を整理します。価格は米ドル表記です。為替、税、アカウントの利用条件は含めていません。
OpenAI APIとGPT APIの違い
GPT APIという名前のサービスが別にあるわけではありません。OpenAI APIを使って、GPT系のモデルに入力を送り、生成された文章やJSON、ツール呼び出しの結果を受け取ります。
たとえば、アプリに「問い合わせへの回答を作る」機能を追加する場合は、次のような流れです。
1. アプリがユーザーの質問を受け取る
2. サーバーがOpenAI APIへ入力とモデル名を送る
3. 指定したモデルが文章や構造化データを生成する
4. アプリが結果を画面に表示する
API形式はResponses APIとChat Completionsが中心
新しくテキスト生成を実装するなら、OpenAI公式ドキュメントが推奨するResponses APIから始めるのが分かりやすいです。テキストだけでなく、ファイル、Web検索、関数呼び出しなどを同じ流れに組み込みやすい設計です。
Chat Completions APIも利用できます。すでにmessages形式で動いている既存アプリを無理に書き換える必要はありません。ただし、これから作るならResponses APIを基準に考える方が、現在のドキュメントや新しい機能に追従しやすいです。
なお、Responses APIとChat Completions APIで別の基本料金がかかるわけではありません。選んだモデルのトークン料金が基本になり、ツールを使った場合はツール料金が加わります。
OpenAI APIのパラメータは何を決める?
パラメータは、モデルに渡す「設定」です。モデルが頭脳なら、パラメータは「どれくらい考えるか」「どれくらい長く答えるか」を決めるつまみです。最初は全部を触らず、model、input、reasoning.effort、text.verbosity、max_output_tokensを押さえれば十分です。
| 設定 | ELI5でいうと | 何を決めるか |
|---|---|---|
model | どの頭脳を使うか | Luna、Terra、Astraなど、担当するモデル |
input/instructions | 何をしてほしいか | 質問、前提、守ってほしいルール |
reasoning.effort | 考える時間をどれだけ取るか | 推論にかける量。対応する段階はモデルごとに異なる |
text.verbosity | 答えをどれくらい詳しくするか | 短く返すか、説明を厚くするか |
max_output_tokens | 答え用の紙を何枚用意するか | 見える回答とリーズニングを合わせた上限 |
temperature/top_p | 答えの揺らぎをどれくらい許すか | 文章のランダムさ。対応モデルで使い、通常はどちらか一方を調整 |
temperatureとreasoning.effortは、似ているようで別物です。前者は「同じ質問に少し違う言い方をするか」、後者は「答えを出す前にどれくらい考えるか」です。リーズニングモデルではtemperatureやtop_pが使えない場合もあるため、モデルの公式ページを確認します。
リーズニングはAIの下書き時間
リーズニング(reasoning)は、モデルが答えを返す前に、問題を分解したり、候補を比べたりするための処理です。人間でいえば、いきなり話すのではなく、頭の中で短い下書きを作る時間に近いです。
Responses APIではreasoning.effortで、その処理にどれくらい力を使うかを指定します。設定できる値はモデルによって異なり、none、low、medium、high、xhigh、maxなどがあります。高くすれば必ず正解になるわけではありません。時間と料金が増えるため、実際の入力で品質が上がるかを比べて決めます。
目安は、単純な分類・抽出ならnoneまたはlow、普段の要約や判断ならlowまたはmedium、複雑な設計や長い調査ならhigh以上です。GPT-5.6 Lunaを大量処理に使うときは、考える時間を必要以上に増やさない方が、安さと速さを活かせます。
リーズニングに使った見えないトークンも、料金とコンテキストの容量を消費します。max_output_tokensは画面に見える回答だけでなく、リーズニング用のトークンも含めた上限です。小さくしすぎると、答えが表示される前に上限へ達してしまうことがあります。
const response = await client.responses.create({
model: "gpt-5.6-terra",
reasoning: { effort: "low" },
text: { verbosity: "low" },
max_output_tokens: 800,
input: "問い合わせを3項目に分類し、JSONで返してください。"
});
この例では、Terraに「少し考える」「短めに返す」「使える出力の上限は800トークン」と伝えています。最初からhighや長い出力を指定するのではなく、代表的な入力で品質、待ち時間、料金を確認するのが安全です。
2026年9月時点のOpenAI APIモデル一覧
モデルは「何でも答えるGPT」だけではありません。文章・推論、コーディング、画像、音声、埋め込み、モデレーションなど、仕事ごとにモデルの系統が分かれています。
| 分野 | 代表的なモデル | 主な用途 |
|---|---|---|
| 文章・推論 | gpt-6-astra、gpt-5.6-sol、gpt-5.6-terra、gpt-5.6-luna | 会話、調査、設計、文章生成、ツール利用 |
| 汎用・小型 | gpt-5.5、gpt-5.4、gpt-5.4-mini、gpt-5.4-nano | 日常の生成、分類、抽出、大量処理 |
| コーディング | gpt-5.3-codex | AIエージェント型のコーディング |
| 画像生成 | gpt-image-2.5-sunburst、gpt-image-2.5-flare、gpt-image-2 | 画像の生成・編集 |
| 音声・リアルタイム | gpt-live-1、gpt-realtime-2.1、gpt-realtime-2.1-mini | 音声会話、リアルタイム処理 |
| 音声認識・読み上げ | gpt-transcribe、gpt-live-transcribe、gpt-4o-mini-transcribe、gpt-4o-mini-tts | 文字起こし、翻訳、音声合成 |
| 埋め込み | text-embedding-3-large、text-embedding-3-small | 検索、類似度判定、推薦、RAG |
| オープンウェイト | gpt-oss-120b、gpt-oss-20b | 自前環境を含む運用を検討するモデル |
このほか、サイバーセキュリティ向けのGPT-5.6 Cyber、ライフサイエンス向けのGPT-Rosalind、モデレーション向けのomni-moderationもあります。利用条件が限られるモデルもあるため、名前だけで採用を決めず、OpenAI公式の全モデル一覧で提供状況を確認してください。
まず見るべき4つのテキストモデル
どれを選ぶか迷ったら、最上位のAstra、バランス型のTerra、難しい仕事向けのSol、大量処理向けのLunaという順番で考えると整理しやすいです。OpenAI公式のモデル一覧も、Astraを複雑な推論・コーディング向け、Terraを知能とコストのバランス、Lunaをコスト重視の高ボリューム向けと説明しています。
| モデル | APIモデルID | 位置づけ | 向いている仕事 |
|---|---|---|---|
| GPT-6 Astra | gpt-6-astra | 最上位 | 複雑な推論、長い調査、設計、ツールをまたぐ仕事 |
| GPT-5.6 Sol | gpt-5.6-sol/gpt-5.6 | プロ向けの旗艦 | 難しい設計、専門業務、品質を優先する生成 |
| GPT-5.6 Terra | gpt-5.6-terra | 知能と価格のバランス | 普段のアプリ機能、調査、文章生成、実装 |
| GPT-5.6 Luna | gpt-5.6-luna | 低コスト・大量処理 | 分類、抽出、定型文、短い応答の大量生成 |
gpt-5.6はGPT-5.6 Solへルーティングされるエイリアスです。モデルIDを固定したい本番環境では、エイリアスの挙動変更を避けるため、公式が案内するスナップショットの利用も検討します。
公式の全モデル一覧には、現行モデルだけでなくDeprecated(非推奨・提供終了予定)のモデルや、ChatGPT向けのモデルも載っています。APIで使える名前を見つけても、それが新規開発の第一候補とは限りません。
<!-- ここに[OpenAI APIのモデル分類図]を入れる:文章・推論モデルを中心に、コーディング、画像、音声、埋め込みへ分岐する全体像 -->
モデル名の「mini」「nano」は役割の違い
miniやnanoは、単に小さいモデルという意味ではありません。一般に、上位モデルよりコストやレイテンシーを抑え、大量処理や範囲が決まった作業に寄せたモデルです。
たとえばGPT-5.4 miniは、コーディングやコンピューター操作、サブエージェントを含む高ボリューム処理向けです。GPT-5.4 nanoは、分類・データ抽出・ランキングのように、速さと単価が重要な仕事に向きます。
著者の見方:同じ価格帯なら、まず最新モデルを試す
同じくらいの価格で、同じ種類の仕事を任せるなら、私は基本的に新しいモデルから試します。既存システムとの互換性、固定スナップショット、専門モデルの方が合う場合は別ですが、最初から古いモデルを選ぶ理由はそれほど多くありません。
Lunaは簡単な大量処理の第一候補
GPT-5.6 Lunaは、分類・要約・整形・抽出のような、手順が決まったバッチ処理でまず候補に入れたいモデルです。1件ごとの差が小さくても、1万件、10万件と処理すると単価の差が効きます。
たとえば問い合わせをカテゴリ分けしたり、議事録から項目を抜き出したりする仕事です。Lunaで通る処理を見つけて、例外が多いものや判断が難しいものだけTerra以上へ回すと、品質とコストの境目を作りやすくなります。
画像生成は実用目的で試せる品質
画像生成は、アイデア出しだけでなく、ブログのサムネイルや説明用素材にも使える品質になっています。私は実用レベルで積極的に試せると感じています。
ただし、生成した画像をそのまま公開するとは限りません。構図、文字の間違い、人物の手、権利関係、ブランドに合う表現かどうかは人が確認します。得意な部分に任せ、最後の判断は人間が持つ分担が扱いやすいです。
文字起こしの後段をLunaに任せる
最近の文字起こしは、音声を文字に変えるだけの作業ではありません。固有名詞や業界用語、会話の背景を先に渡すことで、認識結果を整えやすくなっています。音質や話者が重なる場面では、確認が必要です。
実務では、文字起こしモデルで素材を作り、その後の要約・箇条書き化・JSON化をLunaに任せる構成が扱いやすいです。音声認識に高価なモデルを使い続けるのではなく、必要な段階だけモデルを使い分けると、コストと実用性のバランスを取りやすくなります。
GPTモデルの料金一覧
テキストモデルの料金は、基本的に100万トークン単位の入力料金と出力料金で決まります。最初に見るべき価格表は、次の「入力/出力」です。
主要なテキスト・推論モデル
| モデル | 入力/100万トークン | キャッシュ入力 | 出力/100万トークン | ざっくりした使いどころ |
|---|---|---|---|---|
| GPT-6 Astra | $10.00 | $1.00 | $50.00 | 最も難しい仕事、長い工程の処理 |
| GPT-5.6 Sol | $4.00 | $0.40 | $20.00 | 複雑な専門業務、品質優先 |
| GPT-5.6 Terra | $2.00 | $0.20 | $12.00 | 普段使いとコストのバランス |
| GPT-5.6 Luna | $0.20 | $0.02 | $1.20 | 大量の分類、抽出、短文生成 |
| GPT-5.5 | $5.00 | $0.50 | $30.00 | 複雑なコーディング、専門業務 |
| GPT-5.4 | $2.50 | $0.25 | $15.00 | コーディング、専門業務のコスト調整 |
| GPT-5.4 mini | $0.75 | $0.075 | $4.50 | 高ボリュームのコーディング、サブエージェント |
| GPT-5.4 nano | $0.20 | $0.02 | $1.25 | 分類、抽出、ランキング |
| GPT-5.3-Codex | $1.75 | $0.175 | $14.00 | エージェント型のコーディング |
| GPT-4.1 | $2.00 | $0.50 | $8.00 | 非推論型の指示追従、ツール呼び出し |
| GPT-4o mini | $0.15 | $0.075 | $0.60 | 軽量な定型処理、低コストな生成 |
価格はOpenAI API公式のPricingと各モデルの公式ページを確認しています。モデルの提供状況、料金、割引、廃止予定は変わるため、本番投入前に公式ページを再確認してください。
画像・音声・埋め込みの料金
画像や音声は、テキストモデルと単位が異なります。画像は画像トークンとテキストトークン、音声は音声トークンまたは分単位で計算するモデルがあります。
| 分野 | 代表モデル | 公式ページの主な料金 |
|---|---|---|
| 画像生成 | gpt-image-2.5-sunburst/gpt-image-2.5-flare | 画像入力 $8.00/100万トークン、画像出力 $30.00/100万トークン。テキスト入力は$5.00。 |
| 画像生成 | gpt-image-2 | 画像入力 $4.00/100万トークン、画像出力 $15.00/100万トークン。テキスト入力は$2.50。 |
| リアルタイム音声 | gpt-realtime-2.1 | 音声入力$32.00/100万トークン、音声出力$64.00。テキスト入力$4.00、テキスト出力$24.00。 |
| リアルタイム音声 | gpt-realtime-2.1-mini | 音声入力$10.00/100万トークン、音声出力$20.00。テキスト入力$0.60、テキスト出力$2.40。 |
| 文字起こし | gpt-transcribe | 推定$0.0045/分 |
| 文字起こし | gpt-4o-mini-transcribe | 推定$0.003/分 |
| 埋め込み | text-embedding-3-large | $0.13/100万トークン |
| 埋め込み | text-embedding-3-small | $0.02/100万トークン |
画像の実際の金額は解像度や品質、入力画像の有無で変わります。音声も入力と出力の長さで変わるため、上の表はモデル選定用の目安として見てください。
Embeddingはモデルより検索設計が効く
Embeddingは、文章を「意味が近いか比べやすい数字の列」に変換するモデルです。RAGでは、質問と似た文書を探すための本棚の案内役として使います。
通常のRAGや類似検索なら、text-embedding-3-smallで十分なケースが多いと考えています。Embeddingモデル自体に予算を寄せるより、キーワード検索で固有名詞を拾い、Embedding検索で意味の近い候補を集め、最後にrerank(候補の順位を付け直す処理)する方が、検索全体の精度を上げやすい場面があります。
小さなモデルで始めて、実際の検索失敗を10〜20件集めます。そのうえで「検索結果に必要な文書が入らない」のか、「入っているのに上位に出ない」のかを切り分けると、Embeddingをlargeへ替えるべきか、検索条件やrerankを直すべきか判断できます。
APIツールの追加料金
モデルの出力だけでなく、組み込みツールを呼ぶと別料金が加わります。たとえばWeb検索は1,000回あたり$10.00で、検索結果としてモデルに渡るコンテンツのトークン料金は別にかかります。
| ツール | 公式料金の目安 |
|---|---|
| Web検索 | $10.00/1,000回+検索コンテンツのトークン料金 |
| File search | $0.10/GB・日(1GB無料)+$2.50/1,000回 |
| Hosted Shell/Code Interpreter | コンテナサイズにより$0.03〜$1.92/20分セッション |
APIの機能を増やすほど、「モデル料金だけ見ていたら想定より高くなった」ということが起きます。モデル、トークン、ツールの3つを分けて見積もるのが安全です。
OpenAI APIの料金はどう計算する?
請求額は「モデルを使った回数」だけでは決まりません。入力、キャッシュされた入力、出力、リーズニング、ツール利用の合計で決まります。推論モデルでは、画面に見えないリーズニング用のトークンも出力トークン側の料金に含まれます。
料金 = 入力トークン × 入力単価
+ キャッシュ入力トークン × キャッシュ単価
+ キャッシュ書き込みトークン × 書き込み単価
+ 出力トークン × 出力単価
+ ツール料金
キャッシュ書き込みの料金はモデルや処理方式によって設定が異なります。料金表にCache writesの欄があるモデルでは、キャッシュを作るときのトークンも確認します。
料金計算の例
GPT-5.6 Terraで、1回の処理に入力10万トークン、出力2万トークンを使ったとします。
- 入力:0.1 × $2.00 = $0.20
- 出力:0.02 × $12.00 = $0.24
- 合計:$0.44
同じトークン量をGPT-5.6 Lunaで処理すると、入力$0.02+出力$0.024で、合計は$0.044です。
ただし、単価の安いモデルがいつも安いとは限りません。やり直しが増えたり、人間の確認時間が増えたりすると、システム全体のコストは上がります。定型処理はLuna、難しい判断はTerraやSolというように、作業の失敗コストまで含めて選ぶのが現実的です。
Batch・キャッシュ・Fast modeの違い
- Batch:すぐに返答が必要ない大量処理向けの料金・処理方式です。公式料金表にはStandardとは別のBatch価格が掲載されています。
- キャッシュ入力:同じ指示や長い前提を再利用する場合に、通常の入力より安くなるモデルがあります。
- Fast mode:応答速度を優先する処理方式です。Standardより高い料金になるため、画面上の待ち時間が業務コストになるときに検討します。
「安いモデルを選ぶ」だけでなく、同じプロンプトを繰り返し送らない、不要な出力を長くさせない、急がない処理をBatchへ回す、といった設計も料金に効きます。
用途別にどのモデルを選ぶ?
モデル選びは、性能ランキングより「失敗したときに何が起きるか」で決めると迷いにくくなります。
| やりたいこと | 最初に試すモデル | 切り替えの目安 |
|---|---|---|
| 普通の文章生成、要約、アプリの回答 | GPT-5.6 Terra | 品質不足ならSol、単純な大量処理ならLuna |
| 難しい設計、長い調査、複数ツールの連携 | GPT-6 Astra | 料金を抑えたいならSolやTerraで比較 |
| 分類、抽出、ランキング、短い定型文 | GPT-5.6 Luna/GPT-5.4 nano | 例外ケースが多ければTerraへ切り替え |
| AIエージェント型のコーディング | GPT-5.3-Codex | 汎用の難しい設計はSolやAstraでも比較 |
| 画像生成・編集 | GPT-Image-2.5 Sunburst/Flare | 精度と速度、画像サイズで比較 |
| 文字起こし後の要約・構造化 | 文字起こしモデル+GPT-5.6 Luna | 固有名詞や重要な判断は人が確認。複雑な整理はTerra以上 |
| 音声会話 | GPT-Realtime-2.1/Mini | 低コスト重視ならMini、品質と余裕を優先するなら2.1 |
| 社内検索、RAG、類似文書検索 | text-embedding-3-small | 検索品質を上げたい箇所だけlargeを検討 |
最初から全モデルを比較する必要はありません。代表的な入力を10〜20件ほど用意し、正しさ、出力の長さ、待ち時間、1件あたりの料金を同じ条件で比べる方が判断しやすいです。
OpenAI APIを使い始める最小構成
最初は、サーバーからResponses APIへ1回リクエストを送り、返答と使用トークンを確認できれば十分です。フロントエンドにAPIキーを直接置かないことだけは、最初から守ります。
公式SDKを使ったJavaScriptの最小例は次の形です。
import OpenAI from "openai";
const client = new OpenAI();
const response = await client.responses.create({
model: "gpt-5.6-terra",
input: "OpenAI APIの料金を一文で説明してください。"
});
console.log(response.output_text);
OPENAI_API_KEYは環境変数やシークレット管理サービスから読み込みます。公開リポジトリやブラウザー側のJavaScriptへ埋め込むと、キーを第三者に使われる可能性があります。開発用と本番用のプロジェクトを分け、支出アラートやハードな支出上限も設定しておくと安心です。
まとめ
OpenAI APIの大枠は、「APIからモデルを呼び出し、入力と出力のトークン量に応じて支払う仕組み」です。
- APIはアプリとモデルをつなぐ入口、GPTは選択するモデル群
- 新規のテキスト生成はResponses APIから始めると整理しやすい
- 普段使いはGPT-5.6 Terra、難題はGPT-6 Astra/GPT-5.6 Sol、大量処理はGPT-5.6 Lunaが出発点
- 同じ価格帯なら最新モデルを先に試し、分類・要約・整形・抽出の大量処理はLunaを第一候補にする
- 料金は入力・出力トークン、キャッシュ、ツール利用に分かれる
- パラメータはモデル、指示、考える量、回答の長さ、出力上限を調整する設定
- リーズニングは見えない下書き時間で、品質だけでなく待ち時間と料金にも影響する
- 画像生成は実用目的で試し、文字起こし後の要約・構造化はLunaへつなぐと設計しやすい
- Embeddingは
text-embedding-3-smallから始め、キーワード検索やrerankにも予算を使う - 画像、音声、埋め込みは料金単位が異なる
- 本番ではモデルのスナップショット、APIキー、支出上限も確認する
最初の一歩は、代表的な入力を10件ほど用意して、TerraとLunaで同じ処理を試すことです。文字起こしなら「音声認識→Lunaで要約・構造化」、RAGなら「small→キーワード検索とrerank」の順に小さく組みます。品質が足りない仕事だけ上位モデルへ回すと、性能と料金のバランスをつかみやすくなります。