Japanese business-judgment benchmark: Jev 97.6 vs Laya 36.9 on the same 40 questions
Automotive, embedded, enterprise software and product decisions, three trials each, with questions, expected answers, raw responses and a static HTML report.
# 実務判断ベンチマークJP 日本の商慣習、車載・組込み、エンタープライズソフトウェア、製品開発の判断を題材に、JevとLayaを同じ40問で評価した記録です。設問、想定解、実際の応答、採点コードを公開し、保存済みの応答から静的HTMLを再生成できます。 **[Jev・Laya比較レポート](https://snsk.github.io/jev-laya-japanese-business-benchmark/)** / **[Jev単体レポート](https://snsk.github.io/jev-laya-japanese-business-benchmark/report.html)** > **免責事項:本レポートを実務導入の判断材料として使用しないでください。** 限定された架空の設問に対する検証結果であり、実際の業務での性能・安全性・適合性を保証するものではありません。 > **設問へのPRをお待ちしています** | 2026年9月21日の計測 | 総合点 / 100 | 全3試行合格の設問 | 有効な試行 | | --- | ---: | ---: | ---: | | Jev `jev-1.13.0` | **97.6** | 39 / 40 | 120 / 120 | | Laya `aac6fef/laya-multilingual-mlx`・FP16 | **36.9** | 15 / 40 | 120 / 120 | これは架空の事例を用いた開発用ベンチマークです。正解に必要な条件は問題文に示し、法律や業界慣行の暗記は求めません。想定解は作問者のラベルで、独立した業務担当者によるレビューは未実施です。40問の反復測定から、日本の業務全般の精度を推定するものではありません。 ## 設問と回答例 - [全40問と回答例を読む](benchmark/pilot.review.md):状況、選択肢・判断基準、想定解、採点根拠。 - [設問のYAML](benchmark/pilot.questions.yaml)/[想定解のYAML](benchmark/pilot.answers.yaml):Choice 12問、Score 12問、Noul 12問、複合4問。複合は3種類を1つずつ含み、合計48判断です。 - [Jevの実際の応答](benchmark/published/jev.responses.jsonl)/[Layaの実際の応答](benchmark/published/laya.responses.jsonl):設問IDと反復番号ごとの入力、回答、確率、所要時間。誤答も収録しています。 - [設計・採点の方針](benchmark/DESIGN.md)/[公開データの説明](benchmark/published/README.md)。 モデルに渡すのは `model`・`state`・`questions` だけです。想定解、採点根拠、設問タイトル、タグは推論入力に含めません。Scoreの `criteria` は段階を順序で表した配列で、先頭を0とする段階値を採点に使います。 ## 計測方法 ### 共通条件と採点 同じ本文・設問・選択肢順序で各問を3回、逐次実行します。実行順序はseed `20260921` でシャッフルします。回答キャッシュと事前ウォームアップは使いません。複合の3判断は1呼び出しで取得し、モデルごとに計120回を評価します。設問・想定解・採点条件は実行前に確定し、得点に合わせて変更していません。 **総合点 = 100 × Σ(設問の重み × 3回の合格率)÷ 42** 単独36問の重みは1、複合4問は1.5です。全3回合格時の1問の配点は単独約2.38点、複合約3.57点です。 | 型 | 1試行の合格条件 | 補助指標 | | --- | --- | --- | | Choice | 選択肢が想定解と一致 | 正解率、NLL | | Score | 返却値と正解段階の絶対誤差が0.5以下 | MAE | | Noul | 0.5以上をtrueとした分類が想定解と一致 | 分類正解率、Brierスコア | | 複合 | 3判断すべてが合格し、