madewithlaya

Catalog / Multilingual

0107GitHub

Japanese business-judgment benchmark: Jev 97.6 vs Laya 36.9 on the same 40 questions

Automotive, embedded, enterprise software and product decisions, three trials each, with questions, expected answers, raw responses and a static HTML report.

snsk/jev-laya-japanese-business-benchmarkREADME ↗
# 実務判断ベンチマークJP

日本の商慣習、車載・組込み、エンタープライズソフトウェア、製品開発の判断を題材に、JevとLayaを同じ40問で評価した記録です。設問、想定解、実際の応答、採点コードを公開し、保存済みの応答から静的HTMLを再生成できます。

**[Jev・Laya比較レポート](https://snsk.github.io/jev-laya-japanese-business-benchmark/)** / **[Jev単体レポート](https://snsk.github.io/jev-laya-japanese-business-benchmark/report.html)**

> **免責事項:本レポートを実務導入の判断材料として使用しないでください。** 限定された架空の設問に対する検証結果であり、実際の業務での性能・安全性・適合性を保証するものではありません。

> **設問へのPRをお待ちしています** 

| 2026年9月21日の計測 | 総合点 / 100 | 全3試行合格の設問 | 有効な試行 |
| --- | ---: | ---: | ---: |
| Jev `jev-1.13.0` | **97.6** | 39 / 40 | 120 / 120 |
| Laya `aac6fef/laya-multilingual-mlx`・FP16 | **36.9** | 15 / 40 | 120 / 120 |

これは架空の事例を用いた開発用ベンチマークです。正解に必要な条件は問題文に示し、法律や業界慣行の暗記は求めません。想定解は作問者のラベルで、独立した業務担当者によるレビューは未実施です。40問の反復測定から、日本の業務全般の精度を推定するものではありません。

## 設問と回答例

- [全40問と回答例を読む](benchmark/pilot.review.md):状況、選択肢・判断基準、想定解、採点根拠。
- [設問のYAML](benchmark/pilot.questions.yaml)/[想定解のYAML](benchmark/pilot.answers.yaml):Choice 12問、Score 12問、Noul 12問、複合4問。複合は3種類を1つずつ含み、合計48判断です。
- [Jevの実際の応答](benchmark/published/jev.responses.jsonl)/[Layaの実際の応答](benchmark/published/laya.responses.jsonl):設問IDと反復番号ごとの入力、回答、確率、所要時間。誤答も収録しています。
- [設計・採点の方針](benchmark/DESIGN.md)/[公開データの説明](benchmark/published/README.md)。

モデルに渡すのは `model`・`state`・`questions` だけです。想定解、採点根拠、設問タイトル、タグは推論入力に含めません。Scoreの `criteria` は段階を順序で表した配列で、先頭を0とする段階値を採点に使います。

## 計測方法

### 共通条件と採点

同じ本文・設問・選択肢順序で各問を3回、逐次実行します。実行順序はseed `20260921` でシャッフルします。回答キャッシュと事前ウォームアップは使いません。複合の3判断は1呼び出しで取得し、モデルごとに計120回を評価します。設問・想定解・採点条件は実行前に確定し、得点に合わせて変更していません。

**総合点 = 100 × Σ(設問の重み × 3回の合格率)÷ 42**

単独36問の重みは1、複合4問は1.5です。全3回合格時の1問の配点は単独約2.38点、複合約3.57点です。

| 型 | 1試行の合格条件 | 補助指標 |
| --- | --- | --- |
| Choice | 選択肢が想定解と一致 | 正解率、NLL |
| Score | 返却値と正解段階の絶対誤差が0.5以下 | MAE |
| Noul | 0.5以上をtrueとした分類が想定解と一致 | 分類正解率、Brierスコア |
| 複合 | 3判断すべてが合格し、

Also filed under Multilingual

  1. 0115

    Laya fine-tuned for Burmese topic classification on SIB-200

    A Myanmar-language Laya checkpoint trained on Davlan/sib200, with a Gradio demo space from the same author.

    aungthuhein-dev · Multilingual · free

  2. 0114

    laya-ara: Laya fine-tuned for Arabic NLU on MASSIVE and XNLI

    An Arabic Laya checkpoint trained on AmazonScience/massive and facebook/xnli, with a companion laya-ara-rag ranking model from the same author.

    Wouze · Multilingual · free

  3. 0111

    Laya multilingual in LiteRT for Android and on-device

    Google's LiteRT community conversion of the multilingual checkpoint (tflite), tagged for Android text classification. An English LiteRT build is published alongside it.

    litert-community · Multilingual · free, on-device

  4. 0109

    Feishu message classification bench: Jev 64/64, Laya 20/64 on 64 frozen scenarios

    Synthetic Chinese workplace-chat scenarios with frozen inputs, prompts and labels. Reports classification quality, mis-generated tasks and latency: Jev 253 ms vs Laya 151 ms.

    Feng · Multilingual · 151 ms (Laya) vs 253 ms (Jev)