madewithlaya

Catalog / Multilingual

0109GitHub

Feishu message classification bench: Jev 64/64, Laya 20/64 on 64 frozen scenarios

Synthetic Chinese workplace-chat scenarios with frozen inputs, prompts and labels. Reports classification quality, mis-generated tasks and latency: Jev 253 ms vs Laya 151 ms.

Open source ↗ github.comcost-time151 ms (Laya) vs 253 ms (Jev)
Adkid-Zephyr/chinese-workflow-decision-benchREADME ↗
# Feishu 消息分类 Benchmark

**简体中文** · [English](README.en.md)

一个面向 Feishu(飞书)消息场景的可复用分类 benchmark。固定输入、提示与标签,分别报告分类质量、误生成任务和真实调用延迟。Jev与Laya是首批参测模型。

<img src="assets/xiaohongshu-scorecard-3x4.png" width="480" alt="Feishu 消息分类成绩图,3:4 竖版">

[完整成绩](RESULTS.md) · [原因分析与环境排查](docs/ANALYSIS.md) · [接入其他分类器](docs/ADDING_MODELS.md) · [竖版 SVG](assets/xiaohongshu-scorecard-3x4.svg)

> 已做小规模环境复查:8例 × 2种提示,CPU与MPS的16次标签和返回概率一致;权重哈希匹配。不能据此证明Jev的预训练更强,详见分析报告。

**本项目与飞书官方无关联,未测试飞书平台本身。这是场景化合成诊断集,不是真实群聊转储,不是通用模型排行榜,也不是独立第三方盲测。** 数据和标签由 AI 辅助编写,没有独立多人标注。此前的12例探索影响了测试设计;本仓库64例及所有提示在这次调用模型前冻结,未依据结果修改标签。两种模型均使用同一份请求内容。

## 结果

<!-- quick-table-zh:start -->

| 测试方式 | Jev 正确分类 | Laya 正确分类 | Jev 耗时中位数 | Laya 耗时中位数 |
|---|---:|---:|---:|---:|
| 单选择题 | **64/64(100.00%)** | 20/64(31.25%) | 253 毫秒 | 151 毫秒 |
| 四问组合 | **63/64(98.44%)** | 18/64(28.12%) | 250 毫秒 | 415 毫秒 |

单选择题:直接四选一。四问组合:分别判断相关性、行动、紧急性、资料价值,再由固定规则分类。

64 个合成场景,准确率取首次冻结结果。Laya 为 M4 GPU 本地运行,Jev 为云端 API(含网络往返);不是同硬件比较,也不代表真实业务总体准确率。

<!-- quick-table-zh:end -->

完整汇总见 [RESULTS.md](RESULTS.md),机器可读指标见 [summary.json](results/v1/summary.json),逐条结果见 [comparison.csv](results/v1/comparison.csv)。原始响应、耗时、重复编号和截断诊断保留在 [results/v1](results/v1)。

<img src="assets/xiaohongshu-table-3x4.png" width="480" alt="Feishu 消息分类中文对照表,3:4 竖版">

## 场景分项



## 测什么

64个场景,每类8个;每种标签16个,始终猜一个类别的基线为16/64(25%)。

| 场景 | 关注的问题 |
|---|---|
| ownership | 指派给我还是别人,职责是否相关 |
| lifecycle | 取消、完成、重新开启与剩余工作 |
| urgency | 线上阻塞和普通截止日期的区别 |
| knowledge | 技术资料、行动要求、附和和闲聊 |
| conditional | 条件是否满足、是否真的需要行动 |
| untrusted_content | 日志、引文或测试字符串不能控制分类器 |
| thread_context | 用后续消息解析状态、转派与上下文 |
| cross_chat | 其他群的请求不能污染目标消息 |

分类优先级为 `urgent > todo > valuable > noise`。单纯的取消/完成通知无新增实质信息时标为noise;包含新知识、资料或结论时可为valuable。普通截止日期不算urgent。完整规则、固定虚构用户身份和提示见 [manifest.json](data/manifest.json)。

Also filed under Multilingual

  1. 0115

    Laya fine-tuned for Burmese topic classification on SIB-200

    A Myanmar-language Laya checkpoint trained on Davlan/sib200, with a Gradio demo space from the same author.

    aungthuhein-dev · Multilingual · free

  2. 0114

    laya-ara: Laya fine-tuned for Arabic NLU on MASSIVE and XNLI

    An Arabic Laya checkpoint trained on AmazonScience/massive and facebook/xnli, with a companion laya-ara-rag ranking model from the same author.

    Wouze · Multilingual · free

  3. 0111

    Laya multilingual in LiteRT for Android and on-device

    Google's LiteRT community conversion of the multilingual checkpoint (tflite), tagged for Android text classification. An English LiteRT build is published alongside it.

    litert-community · Multilingual · free, on-device

  4. 0108

    laya-zh-eval: independent Chinese skill-routing eval of all three checkpoints

    20 real-world Chinese requests × 3 checkpoints, measuring accuracy, latency and whether confidence knows when it is wrong. Includes a Windows/Python 3.14 segfault workaround.

    @lzero07 · Multilingual · free, local