Hana’s Note
「いちばん点数が高いAIを選べばいい」と思ったら、表には違う種類の点数がたくさん並んでいる。速さを比べた数字と、難しい科学問題を解いた数字は、同じ“強さ”なのかな。ここをほどくと、自分に合う選び方が見えてきそうにゃ。
Current snapshot|この記事で比べるもの
この記事の問いは、2026年8月時点で、どのAIモデルが自分の用途に合うかです。GPT、Claude、Gemini、Grok、DeepSeek、Kimiの現行モデル群を、難しい推論、日常利用、コーディング、Web調査、画像・長文、費用、open-weightという観点から見ます。
画像や動画を作る専用モデル、企業ごとの非公開契約、すべての国・プランは対象外です。製品の利用上限や価格は変わりやすいため、契約前には公式ページを再確認してください。
比較メモ
- 最終確認: 2026-08-16(JST)
- 比較時点: 2026年8月
- 対象: GPT-5.6、Claude 5、Gemini 3.7 Flash、Grok 4.6、DeepSeek V4、Kimi K3を中心とする現行モデル
- 検証状態: 仕様・提供方針は主に公式情報を確認。横断性能と料金の読み方は、関連解説で確認条件を分けて扱う。日本語文章品質には未確認事項あり
At a glance|先に候補を絞る
| あなたが重視すること | まず試す候補 | 選ぶときの注意 |
|---|---|---|
| 難しい推論・複雑な成果物 | Claude Opus 5、GPT-5.6 Sol | 高い推論設定は料金と待ち時間も増える |
| 長時間の自律的な作業 | Claude Fable 5 | 高価。安全分類後に別モデルで再試行される設定もある |
| 日常利用のバランス | Claude Sonnet 5、GPT-5.6 Terra/Luna、Gemini 3.7 Flash | 日本語の好みと製品の利用上限を自分で比較する |
| コーディング | Opus 5、GPT-5.6 Sol、Fable 5、Grok 4.6、Kimi K3 | モデルよりツールとテスト環境が結果を変える場合がある |
| 図表・画像・長い資料 | GPT、Claude、Gemini、Grok、Kimiの対応モデル | 「長い入力が入る」と「全体を正確に読める」は別 |
| API費用を抑える | DeepSeek V4、Gemini 3.7 Flash、GPT-5.6 Luna | 入出力、再試行、長文、キャッシュを含む総費用で見る |
| open-weight/自前運用 | Kimi K3、DeepSeek V4 | 重みの公開は、普通のPCで簡単に動くという意味ではない |
これは順位表ではありません。たとえば、最高難度の問題を少数解く人と、毎日大量の文書を低コストで処理する人では、よい選択が逆になります。
なぜ「総合一位」を決められないのか
AIモデルそのものと、AIを使う製品は別の層です。ChatGPTやClaudeは製品名、GPTやClaude Opusはモデル名です。製品には、検索、ファイル処理、メモリ、音声、コード実行、利用上限が組み合わさります。
同じモデルでも、Web検索を使えるか、コードを実行できるか、何回まで考え直せるかで結果は変わります。反対に、同じ製品でも、無料・有料プランや課題の種類によって選べるモデルや裏側の処理が異なる場合があります。
ベンチマークの点数も、モデル名だけを示すものではありません。推論設定、ツール、試行回数、エージェント環境が違う数字を一列の順位にすると、実際の選択を誤りやすくなります。評価の条件と数字の読み方は、AIベンチマークとは?AI性能比較の数字をどう読むかで詳しく整理します。
主要モデルの特徴を一行ずつ見る
ここでいう「特徴」は、公式の役割・仕様と公開評価から整理した特徴であり、すべての利用場面での優劣を意味しません。文章の性格や使い心地を、少数の感想からモデル固有の性格として決めてはいません。
| モデル | 特徴 | まだ言えないこと |
|---|---|---|
| GPT-5.6 Sol | 高難度推論、コーディング、Web探索、PC操作を含む上位候補 | あらゆる日常用途で一位とは言えない |
| GPT-5.6 Terra/Luna | 同世代の機能を、バランス/低価格側へ分けた候補 | 日本語文章と実業務の修正量は未比較 |
| Claude Fable 5 | 長時間・複雑なエージェント作業を狙う最上位候補 | 「いつも主体的」と一般化できない。フォールバックもある |
| Claude Opus 5 | 深い推論、コーディング、PC操作の上位候補 | 文体の好みは独立した人間比較が必要 |
| Claude Sonnet 5 | 速度と能力のバランスを狙い、広い製品プランで使える | 期間限定価格と独立評価の不足に注意 |
| Gemini 3.7 Flash | 最新安定のマルチモーダルworkhorse、組み込みツール対応 | 初期の独立評価だけで実利用全体の順位は決められない |
| Grok 4.6 | コーディング、長時間エージェント、画像・対話的成果物の現行候補 | 4.5からの改善は主に提供者評価で、幅広い実利用比較は限定的 |
| DeepSeek V4 | 低価格、長い文脈、open-weight。GAのProと軽量側のFlashを選べる | APIはテキストのみ。2026年8月17日から価格体系が変わる |
| Kimi K3 | native vision、長い文脈、open-weightの現行候補 | 一般的なPCで容易に動くとは言えない |
open-weightは「選べる場所」を増やす
Kimi K3とDeepSeek V4は、モデルの重みが公開されるopen-weightの候補です。自前の環境へ組み込む道があり、API価格も商用最上位モデルより低い水準です。
一方、Kimi K3の技術報告は2.8兆の総パラメータ、1,040億の活性パラメータを示しています。DeepSeek V4にも大規模なProと軽量側のFlashがあります。open-weightでも、必要なGPU、量子化、ライセンス、保守、安全対策を考えると、一般的なノートPCで簡単に使えるとは限りません。
文脈長は「入る量」であって、理解の保証ではない
GPT-5.6、Claude 5、Gemini 3.7 Flash、Kimi K3は、公式仕様で約100万トークン級の入力枠を持ちます。これは本や大量のコードを一度に渡せる大きな容量です。
しかし、長い入力のどこにある情報でも同じ精度で探せるとは限りません。表、脚注、矛盾する記述、複数ファイルの関係を正しく扱えるかは、実際の資料で確認する必要があります。「100万トークン対応」を、そのまま「100万トークンを完全に理解」と読み替えないことが大切です。
用途から選ぶ
難しい推論や複雑な成果物
長い分析、複数の条件を含む計画、高い精度が必要な成果物なら、Claude Opus 5かGPT-5.6 Solを最初の候補にできます。長時間の自律作業を任せる設計ではClaude Fable 5も候補ですが、API単価が高く、安全分類で拒否された要求を設定によりOpus 4.8またはOpus 5で再試行する場合があります。
重要なのは、高価なモデルを常用することではありません。普段はバランス型を使い、難問だけ上位モデルへ切り替える運用も現実的です。
日常の相談、要約、文章
Claude Sonnet 5、GPT-5.6 Terra/Luna、Gemini 3.7 Flashが候補です。ただし、この記事では日本語の自然さを同じ課題で人間比較していません。文章の好みはベンチマーク値から決めず、実際のメール、要約、説明文を匿名にして読み比べるのが確実です。
無料・定額製品ではAPI単価よりも、回数制限、ファイル容量、検索機能、履歴やメモリの使いやすさが体験を左右します。
コーディング
Claude Opus 5、GPT-5.6 Sol、Claude Fable 5に加え、Grok 4.6やKimi K3も候補です。ただし「一問のコードを書く」ことと「既存リポジトリを安全に直す」ことは違います。評価条件とagent harnessの違いは、AIベンチマークとは?AI性能比較の数字をどう読むかを参照してください。
Web調査と学術用途
検索と出典表示を持つ製品の上位モデルを候補にし、モデル名より一次情報へ戻れるかを重視します。BrowseCompで高得点でも、引用先が主張を支えるか、論文と解説記事を区別できるか、最新日付を確認できるかは別の作業です。
科学問題のGPQAやHLEで高得点でも、新しい研究を正しく評価したことにはなりません。論文の実在、該当箇所、計算、実験条件を人間が確認します。AIの回答は、結論ではなく調査の出発点として使うのが安全です。
APIを使う場合は、料金を別に確認する
性能の比較と価格の比較は別に見ます。安いモデルでも、入力量と出力の長さ、ツール利用、再試行、長文割増、キャッシュの有無で総費用は変わります。入力・出力トークン、キャッシュ、長文利用時の見方は、AIモデルの料金比較とAPIコストの考え方で整理します。
読者向けの選択手順
公開ベンチマークより、自分の課題に近い小さな評価のほうが役立つことがあります。
- 実際によく行う課題を3〜5件選ぶ。
- 個人情報や機密情報を除き、同じ指示を各候補へ渡す。
- モデル名を隠して、人間が結果を評価する。
- 正確さ、修正量、完了時間、費用を記録する。
- 正解がない文章では「好き」だけでなく、目的を満たすかを見る。
- 難しい課題は別のAIまたは一次情報で検証する。
モデル選びを一度きりの決定にせず、「日常用」「難問用」「低価格の大量処理用」のように役割を分けると、更新にも対応しやすくなります。
Limitations and what may change
- モデル名、stable/preview、製品プラン、利用上限は変更される。
- 日本語文章、引用品質、長文検索について、この記事独自の人間A/B評価は行っていない。
- 企業向けのデータ保持、学習利用、監査、地域条件は契約ごとに確認が必要である。
- 性能値と料金は比較条件・更新時点に左右される。各記事の比較メモと公式情報を照合する。
Summary
すべての用途に共通する一つの「最強モデル」は決められません。使いたい仕事、必要な正確さ、ツール、予算、データの扱いを先に決めると、候補を絞りやすくなります。
性能の数字はベンチマーク解説、APIの費用は料金解説で条件を確認し、最後は自分の課題で小さく試すことが、もっとも再現しやすい選び方です。
Taka’s View
モデルを一つに決めて安心したくなるけれど、更新の速い時期ほど「普段使う候補」と「難しいときに切り替える候補」を分けたほうが運用しやすいと思う。仕事で使うなら、華やかな一問の成績より、失敗を見つけやすいこと、費用を予測できること、人間が最後に確認できることを重視したい。