専門特化AIモデル図鑑 ── 主要AI各社の「専用モデル」を横断検索
Global AI Radarの続編。汎用フラッグシップではなく、音声認識・コーディング・画像生成・Deep Research・動画生成という5ジャンルの専門特化モデルだけを集めました。ジャンルやベンダー、第三者検証の有無で絞り込めます。
2026年9月19日時点の情報。料金・提供状況は変動するため、最終判断は必ず各社公式ページでご確認ください。
ChatGPT、Claude、Gemini、Grok。生成AIの話をするとき、私たちはつい「どの会社のAIが一番賢いか」というフラッグシップモデル同士の比較に目を向けがちです。
しかし実務でAIを使い倒していくと、必ずぶつかる場面があります。「音声を文字にしたいだけなのに、なぜ高価な汎用モデルを使う必要があるのか」「画像を作りたいだけなのに、なぜコーディングも得意な万能モデルを呼び出すのか」。
答えは単純で、多くの場合その必要はありません。OpenAIにもGoogleにもAnthropicにもxAIにも、そして中国勢の主要ラボにも、特定のタスクだけに最適化された「専門特化モデル」が存在します。Whisperが音声認識特化であるように、GPT ImageやNano Bananaが画像特化であるように。
この記事では、タスク軸で専門特化モデルだけを横断的に整理しました。単なる一覧ではなく、「なぜ汎用モデルではなくこれを使うのか」という判断軸と、「どの数値が独立検証済みで、どれがベンダー自己申告か」という信頼性の切り分けまで踏み込んでいます。
見えてきた2つの構造
各ジャンルを横断して調べていくと、単発の比較記事では見えてこない、ベンダーごとの構造的な非対称性が浮かび上がってきました。
OpenAIは現在、動画生成の主力モデルを持っていません。2025年に登場したSora 2は、2026年4月26日にWeb/アプリ提供を終了し、APIも2026年9月24日に停止予定です。廃止一覧の「推奨移行先」欄はすべて空欄で、後継モデルは発表されていません。報道によれば1日あたり約100万ドルの運用コストに対して収益が見合わなかったことが理由とされています。「主要AIの中に専門特化モデルがある」という本稿の前提そのものが、動画生成というジャンルに限ってOpenAIには成立しない、という事実です。
Anthropicには、音声認識・画像生成・動画生成の専用モデルが存在しません。ClaudeはマルチモーダルでOllama画像や音声を「読む」ことはできますが、Whisperやgpt-4o-transcribeに相当する音声特化モデル、Nano BananaやGPT Imageに相当する画像特化モデルは提供していません。Anthropicの製品ラインは一貫して「コーディング・エージェント・エンタープライズ」に集中しており、これは手薄というより明確な選択と読めます。
このような「誰が何を持っていないか」は、100社を並べる一覧表からは読み取りにくい情報です。
1. 音声認識・音声処理
このジャンルは「文字起こし(ASR)」と「会話型音声(Speech-to-Speech)」の2つに分けて見る必要があります。文字起こしは、正直なところ第三者ベンチマークが一番育っていない領域です。各社ともWER(単語誤り率)を自社発表するのみで、コーディング分野のSWE-bench Verifiedのような業界標準的な公開リーダーボードは確立していません。
一方、会話型音声(Speech-to-Speech)には、Artificial AnalysisのSpeech to Speech Indexという活発に更新される独立指標が存在します。しかも直近1週間だけでGoogleのGemini 3.8 Live Extended Thinking(82.6)がOpenAIのGPT-Live-1(81.5)・xAIのGrok Voice Think Fast 2.0(81.3)を僅差で逆転するなど、順位が入れ替わるほど競争が激しい領域です。文字起こしと会話型音声で「検証環境の成熟度」がこれほど違うというのも、一覧化して初めて見える発見でした。
実例:LocalVoiceでの実測
これは他の解説記事では読めない一次情報です。私は個人開発プロジェクト「LocalVoice」(ローカル音声入力アプリ)で、実際にWhisperの複数サイズを実機比較しました。
- tiny・base・small・mediumの4サイズを同一負荷条件で比較
- tiny/baseは「大阪」が「大さか」になるなど明確な誤認識が発生し不採用
- mediumで精度は安定したが、M1 8GBという実機のメモリ制約下では、システム全体の負荷状況によって処理速度が10倍以上変動することも実測で確認
この経験から言えるのは、「特化モデルの中でどのサイズ/ティアを選ぶか」は、公式スペック表だけでは決められないということです。同じモデルでも、動かす環境のメモリ余力次第で体感速度がまったく変わります。
この開発の詳しい記録は、「AIでAquaVoice風の音声入力アプリを個人開発 ── LocalVoice開発記録」にまとめています。
2. コード生成・エージェント型
このジャンルは5つの中で最も第三者ベンチマークが充実しています。ただし各社が自社に有利な指標だけを公表する傾向が強いため、どの数値が独立検証済みかを明記することが特に重要です。
3. 画像生成
直近1週間で世代交代したばかりのGPT-Image-2.5は、まだ独立リーダーボードに載っていません(2026年9月9日時点)。新しいモデルほど良いとは限らず、「独立検証がまだない」こと自体もリスク情報として扱うべきというのが、このジャンルから得られる教訓です。Nano Banana 2は公開から半年近く独立評価の場に居続けており、その分「実績のある選択肢」としての裏付けがあります。
4. 検索/リサーチ特化(Deep Research系)
Deep Research系は、どのベンダーを選んでも共通の限界があります。出力に含まれる主張が引用元で実際に裏付けられている割合(引用忠実度)は、業界全体として最良でも約80%程度が上限という指摘があります(Aaron Tay, 2025年)。これは特定ベンダーの弱点ではなく、このカテゴリ全体の性質です。したがって使い方としては「1本に絞る」より「ChatGPTで調査設計→Perplexity/Grokで広域探索→Claudeで深層統合」のように役割分担する運用が、複数の実務者の記録から共通して見えてきます。
5. 動画生成
冒頭で触れたとおり、このジャンルは唯一「主要ラボの1社が不在」という状態です。Sora終了後のユーザーの受け皿として、中国勢とxAIのコストパフォーマンスが際立って語られる展開になっています。
まとめ
汎用フラッグシップモデル同士の比較は、各社が毎月のように新モデルを出すため、記事を書いた瞬間から陳腐化が始まります。一方で、専門特化モデルの「立ち位置」は比較的安定しています。音声認識はGoogle/OpenAIの寡占状態が続き、コーディングはAnthropic/OpenAI/xAI/中国勢が並走し、動画生成はOpenAIが不在という構造は、モデルのバージョンが変わっても当面続くと考えられます。
「どのAIが一番賢いか」ではなく「このタスクには、どの会社の、どの専用モデルを充てるべきか」。この記事が、そうした判断の出発点になれば幸いです。


コメント