2026年は文字起こしAIの当たり年でした。OpenAI・Microsoft・Google・Deepgram・Mistral・xAI・Alibaba…半年で10本以上。 測る道具を自作して、同じ音源を13社に流しました。 字幕・議事録・ブログ化・大量処理、それぞれの答えを出します。
半年でこれだけ出ています。各社バラバラのタイミングで出すので、気づいたら選択肢が3倍になっていました。
| 時期 | モデル | 提供 |
|---|---|---|
| 2026-02-05 | Voxtral Transcribe 2(Realtime版はApache 2.0のオープンウェイト) | Mistral AI |
| 2026-02-10 | Qwen3 ASR Flash(52言語・オープンソース系) | Alibaba |
| 2026-03 | Scribe v2 Realtime(150ms・30言語) | ElevenLabs |
| 2026-04-18 | Grok STT 1.0(単語タイムスタンプ+話者分離+500MB) | xAI |
| 2026年 | MAI-Transcribe 1.5 | Microsoft |
| 2026年 | Chirp 3 | |
| 2026年 | Parakeet TDT 0.6B v3(超高速・軽量) | NVIDIA |
| 2026年 | Gemini 3.6 Flash / 3.5 Flash-Lite(音声理解・無料枠あり) | |
| 2026-07 | Melia-1(14モデル中1位と報告) | Speechmatics |
| 2026年 | Universal-3.5 | AssemblyAI |
| 2026-07-28 | GPT-Transcribe / GPT-Live-Transcribe | OpenAI |
7月28日にOpenAIが出したのは2本で、用途で分かれています。録り終わった音声なら $0.0045/分、 喋りながらなら $0.017/分。ここを間違えると3.8倍払うことになります。 この記事では前者だけを扱います(ライブは後編で1本使います)。
1つずつcurlで叩いて目で比べる、というのはやっていられないので、測定ツールを自作しました。 音声や動画をドロップすると全モデルへ同時に流し、精度・料金・返ってくるものを1画面に出します。
正解のテキストは自分で耳で書き起こしています。ここを手抜きすると、 どのモデルが良いかの判定がまるごと狂います。
自分の過去動画から、わざと厳しい40秒を切り出しました(固有名詞・数字・英語混じり)。 全部で 17本まわして6円です。
| 順 | モデル | 提供 | CER | コスト(40秒) | 秒数 |
|---|---|---|---|---|---|
| 1 | MAI-Transcribe 1.5 | Microsoft | 6.72% | $0.0040 | ✗ |
| 1 | Nova-3 | Deepgram | 6.72% | $0.0029 | ✗ |
| 3 | Gemini 3.6 Flash | 10.92% | $0(無料枠) | ✗ | |
| 3 | Chirp 3 | 10.92% | $0.0107 | ✗ | |
| 5 | GPT-4o Transcribe Diarize | OpenAI | 12.61% | $0.0040 | ○ |
| 6 | Voxtral Mini Transcribe | Mistral | 20.17% | $0.0020 | ✗ |
| 8 | Qwen3 ASR Flash | Alibaba | 25.21% | $0.0014 | ✗ |
| 9 | Whisper turbo(ローカル) | — | 28.57% | $0 | ○ |
| 11 | Whisper turbo(Groq) | Groq | 31.93% | $0.0004 | ○ |
| 13 | whisper-1 | OpenAI | 36.13% | $0.0040 | ○ |
| 14 | Grok STT 1.0 | xAI | 51.26% | $0.0011 | ○ |
| 15 | Parakeet TDT | NVIDIA | 148.74% | $0.0010 | ✗ |
順位そのものより、中身を見たときの発見のほうが大事でした。
同じモデル・同じ音源でも、実行のたびに数字が動きます(Gemini は 11.76% → 31.93% → 10.92%)。 1回測って「最強はこれ」と言うのは危険です。 OpenAIの公式ドキュメントにも「代表的な音声で自分でベンチマークしろ」と書かれています。
字幕には「どの言葉が何秒に喋られたか」が要ります。本文テキストだけでは字幕になりません。 そこで新しい GPT-Transcribe に単語タイムスタンプを要求してみると、返ってきたのはこれでした。
response_format 'verbose_json' is not compatible with model 'gpt-transcribe-api-ev3'. Use 'json' or 'text' instead.
返ってこない、ではなく、要求した時点で弾かれます。 つまり GPT-Transcribe で字幕は作れません。
そして測ってみて分かったのですが、タイムスタンプを返すモデルは実は少数派でした。 今回の13社のうち、返すのは5本だけです。しかもその中でいちばん精度が良かったのは、有料上位ではなくローカルのWhisperでした。
僕の結論:動画編集の字幕は、ローカルWhisperのままで良い。 $0で、音声を外に出さずに済みます。ここを乗り換える理由は今のところありません。
この用途で要るのは固有名詞と数字の正確さです。タイムスタンプは要りません。
今回の音源には claude-opus-5 というモデルIDが出てくるのですが、ここで差が出ました。
| モデル | 出力 |
|---|---|
| GPT-Transcribe(用語を先に渡した) | claude-opus-5 / Claude Opus 5 |
| Nova-3 | claude-opus-5 |
| Voxtral | cloud-opas-5 |
| GPT-4o Diarize | crudo-opas-5 |
| Grok STT | クロードハイフンオーパスハイフンファイブ |
GPT-Transcribe だけが3つの固有名詞を全部当てました。理由は「先に言っておける」からです。 文字起こしの前に、出てくる用語を渡せます。会議の前に「今日は〇〇の話です」と共有するのと同じで、 人間に効くことはAIにも効きます。
r = client.audio.transcriptions.create(
model="gpt-transcribe",
file=f,
prompt="AIモデルのレビュー動画。APIの料金とモデルIDの話が出てくる。",
keywords=["Claude Opus 5", "claude-opus-5", "API"],
languages=["ja", "en"],
)
ただしこの用途の答えは「まず無料枠を試す」です。Gemini Flash が10.92%で、 $0.0107のChirp 3と同着、有料のOpenAI Diarize(12.61%)より上でした。しかも$0です。 固有名詞が特に多い仕事のときだけ、用語を渡せる GPT-Transcribe に払う価値があります。
議事録には話者分離(誰が喋ったか)が要ります。ここには落とし穴が2つありました。
一方 Grok STT はフラグを1つ足すだけで、話者ラベルと単語の秒数が同時に返ってきます。 議事録を作るなら、ここは差が大きいところです。
curl -X POST https://api.x.ai/v1/stt \ -H "Authorization: Bearer $XAI_API_KEY" \ -F file=@meeting.m4a -F language=ja -F diarize=true
インタビュー、講義、過去アーカイブ。1時間の音声を何本も回すなら、見るのは単価と上限です。
| 使うもの | 1時間あたり | 備考 |
|---|---|---|
| ローカルWhisper | $0 | 時間はかかるが無制限・外に出さない |
| Groq Whisper turbo | $0(無料枠) | 1日2,000回・7,200音声秒/時=事実上使い放題 |
| Gemini Flash | $0(無料枠) | 1日1,000回級 |
| Grok STT | $0.10 | 500MBまで一括投入できる |
| Nova-3 | $0.26 | 精度重視 |
| GPT-Transcribe | $0.27 | 用語ヒントが効く |
Groq は 40秒の音声が0.9秒で返ってきました。しかも無料枠の中です。 ここを知らずに月額を払うのは、正直もったいない。
| 層 | 使うもの | 費用 |
|---|---|---|
| ① ローカル | Whisper large-v3-turbo(whisper.cpp) | $0・音声を外に出さない |
| ② 無料枠 | Gemini Flash / Groq Whisper | 枠内なら $0 |
| ③ 直接契約 | OpenAI(GPT-Transcribe ほか) | 60分で $0.27〜0.36 |
| ④ ゲートウェイ | OpenRouter で Microsoft・Deepgram・Mistral・Google・Alibaba・xAI | キー1本・従量 |
実用的なのは④です。各社と契約すると、使わない月も基本料を払うことになります。 OpenRouter ならキー1本で13モデル。今日の検証も、全部で6円でした。
クレジット購入時に 5.5%+最低$0.80 かかります。$5だと実質16%になるので、 入れるなら$10から。キー単位で使用上限を設定できるので、事故防止に必ず設定してください。
| やりたいこと | 使うもの | 費用 | 理由 |
|---|---|---|---|
| 動画の字幕・テロップ | ローカルWhisper | $0 | タイムスタンプが要る。精度も上位陣と大差ない |
| 長い音声を丸ごと字幕に | Grok STT | $0.10/時 | 500MBまで一括(他は25MB) |
| ブログ化・要約 | Gemini Flash(無料枠) | $0 | 実測3位。足りなければ Nova-3 |
| 固有名詞が多い原稿 | GPT-Transcribe | $0.27/時 | 用語を先に渡せるのはここだけ |
| 会議の議事録 | Grok STT(diarize) | $0.10/時 | 話者+秒数が一度に返る |
| 大量処理 | Groq Whisper(無料枠) | $0 | 1日2,000回・0.9秒で返る |
| ライブ字幕 | → 次回 | — | GPT-Live-Transcribe ほか |
「最強のモデル」を探すのはもうやめました。 用途ごとに要るものが違うので、用途で選ぶ。そして多くの工程は無料枠で足ります。