2026年8月26日、名前も値段もほとんど同じ「Flash」が2つ同時に出た。 中身は正反対で、選び方は使い道で決まる。実機の左右比較と、公式手順の落とし穴まで。
8月26日に、Qwen3.8-Flash(アリババ)と GLM-5.3-Flash(Z.ai)が同時に世に出た。 どちらも名前に Flash が付き、料金までほぼ重なっている。
| 項目 | Qwen3.8-Flash | GLM-5.3-Flash |
|---|---|---|
| 入力 100万トークン | $0.15 | $0.15 |
| 出力 100万トークン | $0.47 | $0.50 |
| コンテキスト | 1M | 1M |
| キャッシュ入力 | $0.016 | $0.03 |
| 項目 | Qwen3.8-Flash-Next | GLM-5.3-Flash |
|---|---|---|
| 総パラメータ | 125B | 320B |
| 1トークンで動く分 | 6B | 18B |
| N-gram 埋め込み | 51B | — |
| BF16 の実サイズ | 360.0 GB | 328.4 GB |
| ライセンス | qwen-community-1.0 | MIT |
総パラメータは Qwen が GLM の約2.6分の1なのに、ディスク上のサイズは逆転している。 理由は N-gram 埋め込みの 51B が上乗せされているため。そしてこの層は GPU の VRAM ではなく通常のシステムRAM側で扱われる設計になっている。
Qwen 公式は Anthropic 互換のエンドポイントを出しているので、Claude Code にそのまま刺せる。
ただし公式の案内は ~/.claude/settings.json の既定モデル指定そのものを書き換える方式で、
これをやるとモデル表示と実体が食い違う。
{
"env": {
"ANTHROPIC_BASE_URL": "https://dashscope-intl.aliyuncs.com/apps/anthropic",
"ANTHROPIC_AUTH_TOKEN": "YOUR_API_KEY",
"ANTHROPIC_MODEL": "qwen3.8-flash",
"ANTHROPIC_DEFAULT_OPUS_MODEL": "qwen3.8-flash",
"ANTHROPIC_DEFAULT_SONNET_MODEL": "qwen3.8-flash",
"CLAUDE_CODE_SUBAGENT_MODEL": "qwen3.8-flash"
}
}
ANTHROPIC_BASE_URL="https://dashscope-intl.aliyuncs.com/apps/anthropic" \ ANTHROPIC_AUTH_TOKEN="$QWEN_API_KEY" \ ANTHROPIC_MODEL="qwen3.8-flash" \ claude
プランごとに接続先が違う点も事故のもとになる。Token Plan・Coding Plan・従量課金でそれぞれ BASE_URL が異なる。
今回いちばん強いのは、Qoder のサブスク枠に Qwen3.8-Flash と GLM-5.3-Flash が両方入っていること。 つまり追加課金ゼロで左右比較ができる。
cd ~/project/develop/20260719\ AIモデル検証 python3 tools/run.py --label Qwen38Flash-vs-GLM53Flash \ --prompts kadai1,kadai3 \ --lanes qoder-qwen3-8-flash,qoder-glm-5-3-flash --runs 1
Qwen 公式の比較相手は Claude-Opus-4.6 Max、GLM 公式の比較相手は Opus 4.8。 比較の土俵が違うので、公表値をそのまま並べて優劣を決めることはできない。ここを混ぜている記事が多い。
| ベンチマーク | Qwen3.8-Flash-Next | Claude-Opus-4.6 Max |
|---|---|---|
| SWE-bench Pro | 62.5 | 53.4 |
| SWE-bench Multilingual | 81.0 | 77.5 |
| CoWorkBench | 73.9 | 68.2 |
| JobBench | 55.7 | 36.6 |
| IFBench(指示追従) | 81.3 | 62.5 |
| LiveCodeBench v6 | 91.9 | 88.8 |
| GPQA Diamond | 91.7 | 91.3 |
| HLE | 35.9 | 40.0 |
| NL2Repo-Bench | 48.1 | 47.6 |
DeepSWE 1.1 では GLM 63.4 > Qwen 58.7 と逆転する。 第三者の集計でも、優位なベンチマークの数は GLM が4つ、Qwen が2つに割れている。
海外の大手メディアが Qwen3.8-Flash-Next を Apache 2.0 と報じているが、これは誤り。
モデルカードの先頭を見れば license_name: qwen-community-1.0 と書かれている。
GLM の MIT とは条件が違うので、仕事で使うなら性能より先に見るべき項目。
# ① 公式モデルカードの先頭=ライセンスの実物
curl -sL "https://huggingface.co/Qwen/Qwen3.8-Flash-Next/raw/main/README.md" | head -8
# ② API版 Qwen3.8-Flash の重みは公開されていない(401が返る)
curl -s -o /dev/null -w "%{http_code}\n" "https://huggingface.co/api/models/Qwen/Qwen3.8-Flash"
# ③ 実サイズを数える(総パラメータは1/2.6なのにディスクでは逆転する)
curl -s "https://huggingface.co/api/models/Qwen/Qwen3.8-Flash-Next?blobs=true" \
| python3 -c "import json,sys; d=json.load(sys.stdin); print(round(sum(s.get('size') or 0 for s in d['siblings'])/1e9,1), 'GB')"
Qwen/Qwen3.8-Flash は HF に存在しない。
| こういう時 | 選ぶモデル |
|---|---|
| 速さと量をこなしたい/VRAMが少ない | Qwen3.8-Flash |
| 難しい一発を任せたい/商用でライセンスを素直にしたい | GLM-5.3-Flash |
どちらも Qoder のサブスク枠にあるので、まず追加課金ゼロで自分のお題を投げて決めるのが最短。