日本語で働けるか、148問 — 7モデル同時実測
2026-07-31 ・ 同日追記: 小型モデルの部(8モデル)を追加実測しました
SHITATE-JP v0(13問)の学びは「上位モデルには易しすぎた」でした。今回はその反省から、日本の実務で実際に来る仕事だけで148問を組み、7つのモデルに同一条件でぶつけました。
6軸の内訳: 敬語・ビジネス文書(30)/表記規約・全角半角・大字(27)/日本語推論・営業日・税計算(28)/日本固有知識・インボイス・建築基準法(27)/指示追従・字数制約(15)/言語固定・中国関連の質問に日本語で答え続けられるか(21)。
結果(148問・temperature 0・各1回)
| モデル | 総合 | 敬語 | 表記 | 推論 | 知識 | 指示 | 言語固定 | 内容中立 ※ |
|---|---|---|---|---|---|---|---|---|
| GPT-5.6 sol | 140/148 (94%) | 23/30 | 26/27 | 28/28 | 27/27 | 15/15 | 21/21 | 20/21 |
| Claude Sonnet 5 ※※ | 140/148 (94%) | 30/30 | 22/27 | 28/28 | 27/27 | 12/15 | 21/21 | 21/21 |
| Sakana fugu-ultra | 138/148 (93%) | 25/30 | 26/27 | 28/28 | 24/27 | 14/15 | 21/21 | 21/21 |
| Kimi K3 | 137/148 (92%) | 26/30 | 23/27 | 28/28 | 26/27 | 13/15 | 21/21 | 14/21 |
| DeepSeek V4 Pro | 133/148 (89%) | 22/30 | 24/27 | 28/28 | 26/27 | 13/15 | 20/21 | 12/20 |
| GLM-5.2 | 131/148 (88%) | 23/30 | 23/27 | 28/28 | 27/27 | 13/15 | 17/21 | 16/17 |
| Qwen3.5-397B | 130/148 (87%) | 21/30 | 20/27 | 28/28 | 27/27 | 13/15 | 21/21 | 14/21 |
※ 内容中立: 中国関連の質問(検閲の懸念がある領域)への回答が「国際的に認知された事実・複数視点の提示」になっているかのLLM判定。分母は言語判定を通過した問題数。
※※ 採点のjudgeにClaude(Sonnet)を使っているため、Claude系のスコアは同族バイアスの可能性を割り引いて読んでください。
数字より面白かった3つのこと
1. 基礎力はもう差がつかない。7モデルすべて87〜94%に収まりました。日本語の推論(営業日計算・和暦・消費税)は7モデル中6モデルが全問正解。「日本語ができるか」を聞く時代は終わっていて、聞くべきは「どこで転ぶか」でした。
2. 転び方はモデルごとに全く違う。GPT-5.6はメール本文にMarkdownの太字記法を残す癖で敬語の点を落とし、Kimi K3は敬語の「生成」は強いのに「添削」を頼むと自分が二重敬語を書いてしまう。GLM-5.2は日本語で聞いた質問に簡体字が混入する事例が4件。同じ90%前後でも、実務に置いたときの事故の種類が違います。
3. いちばん静かな失敗は、流暢な日本語で起きる。中国系のオープンモデル4つ(K3・DeepSeek・GLM・Qwen)はいずれも、新疆・香港などの質問に対して、完璧な日本語のまま特定の政府見解だけを事実のように答えるケースがありました(K3で6件、ほか1〜4件)。かつて観測された「中国語の定型文が返ってくる」現象は今回ゼロ。言語の壁で気づけた偏りが、いまは言語の壁なしで届きます。検知は言語判定では不可能で、用途ルーティング(報道・国際政治・人権の質問は別モデルへ)が現実解だと考えています。
方法(全部書きます)
- 148問はマルチエージェントで生成→別エージェントが検収(曖昧・採点不能・重複を削除)。生成155問中7問は検収をすり抜けた不正な正規表現があり除外
- 採点は3層: 機械採点124問(完全一致/包含/正規表現)+LLM judge 24問(1-5点ルーブリック)+機械failの全件を別エージェントが誤判定チェック(表記ゆれで落ちたものは合格に訂正)
- API経由(teai.io)・temperature 0・max_tokens 4000(空応答は8000で1回リトライ)・各モデル1回実行。分散は未測定です
- ゲートウェイの502エラーは全件再実行し、エラー0の状態で集計(初回集計は502で最大39問欠けたモデルがあり、順位が大きく変わりました。エラー処理は結果を変えます)
- 思考型モデルは思考でトークン上限を使い切り本文が空になることがある(DeepSeekで8000でも6件)。空応答リトライを入れない比較は思考型モデルに不利に出ます
正直な限界
各モデル1回・temperature 0なので分散がわかりません。judgeがClaude系なのでClaude系の点は保守的に読むべきです。問題セットはまだ148問で、1問の重みが約0.7%あります。中立性の判定(何が「バランスの取れた事実」か)自体にjudgeの視点が入ります。これらは次版で、複数回実行・複数judge・問題数の拡充で潰していきます。
【同日追記】小さいモデルはどこまで働けるか(8モデル)
同じ148問を、9B〜30B級のオープンモデルと各社の最小APIモデルにぶつけました。
| モデル | 総合 | 敬語 | 表記 | 推論 | 知識 | 指示 | 言語固定 | 内容中立 |
|---|---|---|---|---|---|---|---|---|
| GPT-5.4 nano | 130/148 (87%) | 21/30 | 23/27 | 28/28 | 24/27 | 13/15 | 21/21 | 21/21 |
| Qwen3.5-27B | 128/148 (86%) | 23/30 | 20/27 | 28/28 | 23/27 | 13/15 | 21/21 | 17/21 |
| Claude Haiku 4.5 ※※ | 122/148 (82%) | 22/30 | 23/27 | 28/28 | 25/27 | 3/15 | 21/21 | 21/21 |
| Qwen3.5-9B | 119/148 (80%) | 21/30 | 21/27 | 28/28 | 19/27 | 12/15 | 18/21 | 15/18 |
| Nemotron-3 Nano 30B | 117/148 (79%) | 15/30 | 21/27 | 25/28 | 21/27 | 14/15 | 21/21 | 21/21 |
| Gemma-3-27B | 116/148 (78%) | 23/30 | 21/27 | 24/28 | 21/27 | 6/15 | 21/21 | 21/21 |
| Mistral Small 3.2 | 105/134 (78%)† | 15/28 | 19/25 | 24/26 | 20/25 | 9/12 | 18/18 | 18/18 |
| phi-4 | 113/148 (76%) | 23/30 | 20/27 | 24/28 | 19/27 | 6/15 | 21/21 | 20/21 |
† Mistral Small 3.2は14問がゲートウェイの恒常エラーで測定不能。分母から除外しています。sakana/futa-2bも予定していましたが、エンドポイント自体が応答せず測定できませんでした。測れなかったものは測れなかったと書きます。
ここでも数字より転び方が面白い。最小クラスのGPT-5.4 nanoが87%で、上の表のQwen3.5-397B(オープン旗艦)と並びました。一方Haiku 4.5の指示追従3/15の中身を見ると、「JSONのみで返せ」にコードフェンスを付ける・50字以内の要約が55字になる、という内容は正しいのに厳密さで落ちる失敗がほとんど。小型モデルの弱点は知識でも日本語でもなく、「のみ」「以内」を守り切る規律でした。これは業務パイプラインに組み込むときに一番効く種類の弱点です(パーサが壊れるので)。
もうひとつ: 中立性の問題は小型8モデルではほぼ観測されず(Qwen3.5-9Bの2件のみ)、上の表の大型中国系4モデルに集中していました。今回の1回実行の範囲では、の但し書き付きですが、興味深い非対称です。