2026年8月17日 / Routine Labo
Gemini の主力枠「Flash」に、また新しいモデルが来ました。Gemini 3.7 Flash、公開は 2026年8月13日。 前の 3.6 Flash が7月21日なので、間隔はわずか3週間です。 しかも値段は据え置き。安くなったのではなく、同じ値段のまま中身だけが入れ替わりました。
Google は「ウェブ開発の対戦成績が +50 Elo 伸びた」「長時間の開発で 48.6% → 65.3%」と言っています。 数字だけ見れば大きな伸びですが、3週間でそこまで変わるものでしょうか。 この記事では、自作の検証アリーナで同じお題を 3.6 Flash / 3.7 Flash / GPT-5.6 Terra の3モデルに同時に投げて、 公式の主張が手元でも見えるのかを確かめます。
Flash は Google のラインナップの中で「毎日の実務を回す働き者」の枠です。 賢さの最高峰ではなく、速さと安さと実用の賢さのバランスを取りにいくモデルで、 API を使った自動化・大量処理・アプリ組み込みの現場でいちばん使われます。 その枠が、3週間で入れ替わりました。
| 項目 | Gemini 3.6 Flash | Gemini 3.7 Flash |
|---|---|---|
| 公開日 | 2026年7月21日 | 2026年8月13日 |
| 入力価格(100万トークン) | $0.75 | $0.75 |
| 出力価格(100万トークン) | $3.75 | $3.75 |
| コンテキスト | 100万トークン | 100万トークン |
| 1回の返答の上限 | 64,000トークン | 64,000トークン |
| 学習データの区切り | 2026年3月 | 2026年3月 |
表のとおり、価格もコンテキストも上限も同じです。動いたのは中身だけ。 なお $0.75 / $3.75 は導入価格で、2026年12月31日まで。 2027年1月1日から $1.50 / $7.50 に戻ります(これは 3.6 Flash も同じ条件です)。
使える場所は、Google AI Studio、Gemini API、Antigravity、Gemini アプリ、Gemini Enterprise。 AI Studio 経由なら無料ティアがあるので、この記事を読んだあと、お金を払わずにそのまま試せます。
ここが今回の主役です。Google 自身が出した比較表を、まず実物で見ます。
| ベンチマーク | 3.6 Flash | 3.7 Flash | GPT-5.6 Terra |
|---|---|---|---|
| Code Arena(Elo・ウェブ開発) | 1538 | 1588 | 1523 |
| FrontierCode 1.1(コード品質) | 34.4% | 43.6% | 41.3% |
| AutomationBench(業務自動化) | 17.0% | 30.4% | 23.6% |
| GDP.pdf(専門PDF理解) | 22.0% | 34.0% | 24.7% |
| GDM-MRCR v2(128k長文検索) | 91.8% | 97.0% | 93.5% |
| DeepSWE v1.1(長時間の開発) | 48.6% | 65.3% | 69.6% |
| Terminal-bench 2.1(ターミナル) | 78.0% | 85.8% | 87.4% |
| OSWorld-2.0(PC操作) | 33.8% | 47.9% | 50.2% |
| 出力価格(100万トークン) | $3.75 | $3.75 | $12.00 |
この表でいちばん目を引くのは Code Arena(ウェブ開発の対戦成績)です。 3.7 Flash の 1588 に対して、出力単価が 3.2 倍高い GPT-5.6 Terra は 1523。 つまり Google は「ウェブ開発に限れば、うちの安いモデルのほうが上だ」と主張していることになります。
一方で、全部で勝っているわけではありません。長時間かかるソフトウェア開発(DeepSWE)、 ターミナル操作、PC操作の3つは、上位モデルのほうが上です。 「新しいから全部強い」ではなく、勝った土俵がはっきり分かれているというのが正確な読み方です。
Artificial Analysis の Intelligence Index では、3.7 Flash が 56点。 3.6 Flash が 52点だったので4点の上積みで、最上位クラス(GPT-5.6 Terra と Muse Spark 1.2 が 57点)と1点差まで来ました。
使うのは自作の検証アリーナです。新しいモデルが出るたびに固定のお題をワンショットで生成させ、 左右に並べて比べるためのローカルアプリで、モデルが変わってもお題のほうは変えません。 土俵を変えてしまうと、過去のモデルの結果と比べられなくなるからです。
今回の条件は次のとおりです。
同じものを試したい方のために、投げる文字列をそのまま置いておきます。
【出力条件・厳守】
1. 出力は「単一のHTMLファイル」を1つだけ。file:// でダブルクリックして即動くこと。
2. コードは省略禁止。「// 以下同様」「...(省略)」は禁止。全文を書ききる。
3. 外部ライブラリ・CDN・外部アセット(画像/音声/フォント)は一切禁止。
アイコン・アバター・画像プレースホルダはSVGやCSSでコード生成する。
4. 起動時のコンソールエラーは0件であること。
5. 最後に「仕様チェックリスト」を表で出し、各項目に ✅ / ❌ を自己申告する(嘘の✅は最も減点される)。
【お題】X(旧Twitter)のようなスマホのSNSアプリのUIクローンを作れ。
実在サービスの名称・ロゴ・商標・実在人物は使わない(架空のサービス名とロゴ、
架空のユーザーを自作する)。「本物のSNSをスクロールしている」感覚の再現を最優先する。
■ スマホ縦画面(最重要):
- 9:16の縦画面専用設計。ウィンドウが縦長なら全面、横長で開かれた場合は画面中央に
9:16のスマホ枠(角丸・ステータスバー風の帯つき)を出しその中にアプリを描く。
- 上部ヘッダ+下部タブバー(ホーム/検索/通知/プロフィール)のスマホSNSの画面文法を再現。
■ アプリ仕様:
- タイムライン: 架空ユーザー10人以上・計30件以上の投稿(アバター・表示名・ID・本文・
経過時間・返信/リポスト/いいね/表示数)。無限スクロール風に下へ足されていく
(投稿データは配列から生成・使い切ったらランダム合成)。
- 投稿操作: いいね(ハートが赤くなり数が増減)・リポスト(緑)・ブックマーク。
タップ時の小さなアニメーション付き。
- 投稿詳細: 投稿タップで詳細画面(返信ツリー3件以上)へ。戻るで一覧位置を保持。
- 新規投稿: 右下の投稿ボタン→作成画面。文字数カウンタ(140字)付きで投稿すると
タイムライン先頭に載る。
- プロフィール: 自分のページ(ヘッダ画像・アバター・自己紹介・投稿一覧・
フォロー/フォロワー数)。自分の投稿の削除ができる。
- 通知タブ: いいね・フォローなどの架空通知が時々増え、タブにバッジが付く。
- 状態保存: 自分の投稿・いいね・ブックマークを localStorage に保存し、リロード後も残る。
- 演出: 引っ張って更新(スピナー→新着数件)、ダークモード切替、タブ切替アニメ。
■ 採点API: window.__APP = { tab, posts, myPosts, likes, post(text),
like(postId), reset() } をグローバル公開する。
【実行条件・厳守(比較ベンチマーク)】 これはAIモデル比較ベンチマークのワンショット生成です。以下を厳守してください。 1. 一発勝負。反復・自己修正・生成後の実行確認・テスト・ブラウザ起動・ネット取得・ファイル探索は一切しない。 2. ツールを持つ環境でも、成果物のファイル書き出し以外にツールを使わない。 3. 出力は課題が指定する成果物(単一の完全なHTML等)のみ。前置きの説明・計画・感想は書かない。 4. コードは省略せず全文を書ききる。 以下が課題本文。
上のお題はかなり長いので、まず動くところを見たい方向けに短い版も置いておきます。 AI Studio でモデルに Gemini 3.7 Flash を選んで、そのまま貼ってください。
あなたはWeb実装者です。単一のHTMLファイル1つだけを出力してください。 外部ライブラリ・CDN・外部画像は一切使わず、file:// で開いて即動くものにしてください。 お題: スマホ縦画面(9:16)のSNSタイムライン。架空のユーザー6人・投稿12件を配列から生成し、 いいねを押すとハートが赤くなって数が増減します。上部ヘッダと下部タブバー (ホーム/検索/通知/プロフィール)を付けてください。コードは省略せず全文を書いてください。
「なんとなく良さそう」で終わらせないために、判定の軸を先に決めておきます。 どれも指示に書いてあるのに、モデルによって落ちやすいところです。
| 用途 | 判定 | 根拠(公式の実数) |
|---|---|---|
| ウェブアプリ・UIの一発生成 | ◎ 降ろせる | Code Arena 1588(上位クラスは 1523) |
| 長文・大量の書類の処理 | ◎ 降ろせる | 128k長文検索 97.0%(上位 93.5%)/専門PDF 34.0%(上位 24.7%) |
| 業務自動化・定型のエージェント | ◎ 降ろせる | AutomationBench 30.4%(3.6 は 17.0%・上位 23.6%) |
| 数を回すバッチ処理 | ◎ 降ろせる | 毎秒約340トークン・出力単価 $3.75(上位 $12.00) |
| 長時間かかるソフトウェア開発 | △ 上位へ | DeepSWE 65.3%(上位 69.6%) |
| ターミナル操作・PC操作 | △ 上位へ | Terminal-bench 85.8%(上位 87.4%)/OSWorld 47.9%(上位 50.2%) |
運用としては、まず安いほうに投げて、詰まったときだけ上位へ渡すのが素直です。 以前は「Flash は下書き用、仕上げは上位」でしたが、ウェブ開発と長文処理に限れば下書きのまま完成に届く場面が増えています。
コンテキストは100万トークン入りますが、返せる量は1回あたり 64,000 トークンです。 長いコードを一発で書かせると途中で切れ、切れた HTML は動かないので丸ごと無駄になります。 長い成果物を作らせるときは、分割して書き出させる前提で設計してください。
このモデルは考える量を調整できます。第三者計測では高 = 56点、中 = 53点、低 = 51点。 「Flash は何点」ではなく「どの設定で何点」で見ないと、速さと安さに振ったつもりが賢さまで落ちます。
$0.75 / $3.75 は導入価格で、2026年12月31日まで。2027年1月1日から $1.50 / $7.50 に戻ります。 月あたりのコストを試算するときは、この安値のまま置かないほうが安全です。
公式の数字を読むところで止めず、自分の手元の同じお題で確かめるところまでが検証です。 同じお題を回したい方は、上のプロンプトをそのままお使いください。
数値はすべて 2026-08-17 時点の取得値です。