Feishu message classification bench: Jev 64/64, Laya 20/64 on 64 frozen scenarios
Synthetic Chinese workplace-chat scenarios with frozen inputs, prompts and labels. Reports classification quality, mis-generated tasks and latency: Jev 253 ms vs Laya 151 ms.
# Feishu 消息分类 Benchmark **简体中文** · [English](README.en.md) 一个面向 Feishu(飞书)消息场景的可复用分类 benchmark。固定输入、提示与标签,分别报告分类质量、误生成任务和真实调用延迟。Jev与Laya是首批参测模型。 <img src="assets/xiaohongshu-scorecard-3x4.png" width="480" alt="Feishu 消息分类成绩图,3:4 竖版"> [完整成绩](RESULTS.md) · [原因分析与环境排查](docs/ANALYSIS.md) · [接入其他分类器](docs/ADDING_MODELS.md) · [竖版 SVG](assets/xiaohongshu-scorecard-3x4.svg) > 已做小规模环境复查:8例 × 2种提示,CPU与MPS的16次标签和返回概率一致;权重哈希匹配。不能据此证明Jev的预训练更强,详见分析报告。 **本项目与飞书官方无关联,未测试飞书平台本身。这是场景化合成诊断集,不是真实群聊转储,不是通用模型排行榜,也不是独立第三方盲测。** 数据和标签由 AI 辅助编写,没有独立多人标注。此前的12例探索影响了测试设计;本仓库64例及所有提示在这次调用模型前冻结,未依据结果修改标签。两种模型均使用同一份请求内容。 ## 结果 <!-- quick-table-zh:start --> | 测试方式 | Jev 正确分类 | Laya 正确分类 | Jev 耗时中位数 | Laya 耗时中位数 | |---|---:|---:|---:|---:| | 单选择题 | **64/64(100.00%)** | 20/64(31.25%) | 253 毫秒 | 151 毫秒 | | 四问组合 | **63/64(98.44%)** | 18/64(28.12%) | 250 毫秒 | 415 毫秒 | 单选择题:直接四选一。四问组合:分别判断相关性、行动、紧急性、资料价值,再由固定规则分类。 64 个合成场景,准确率取首次冻结结果。Laya 为 M4 GPU 本地运行,Jev 为云端 API(含网络往返);不是同硬件比较,也不代表真实业务总体准确率。 <!-- quick-table-zh:end --> 完整汇总见 [RESULTS.md](RESULTS.md),机器可读指标见 [summary.json](results/v1/summary.json),逐条结果见 [comparison.csv](results/v1/comparison.csv)。原始响应、耗时、重复编号和截断诊断保留在 [results/v1](results/v1)。 <img src="assets/xiaohongshu-table-3x4.png" width="480" alt="Feishu 消息分类中文对照表,3:4 竖版"> ## 场景分项 ## 测什么 64个场景,每类8个;每种标签16个,始终猜一个类别的基线为16/64(25%)。 | 场景 | 关注的问题 | |---|---| | ownership | 指派给我还是别人,职责是否相关 | | lifecycle | 取消、完成、重新开启与剩余工作 | | urgency | 线上阻塞和普通截止日期的区别 | | knowledge | 技术资料、行动要求、附和和闲聊 | | conditional | 条件是否满足、是否真的需要行动 | | untrusted_content | 日志、引文或测试字符串不能控制分类器 | | thread_context | 用后续消息解析状态、转派与上下文 | | cross_chat | 其他群的请求不能污染目标消息 | 分类优先级为 `urgent > todo > valuable > noise`。单纯的取消/完成通知无新增实质信息时标为noise;包含新知识、资料或结论时可为valuable。普通截止日期不算urgent。完整规则、固定虚构用户身份和提示见 [manifest.json](data/manifest.json)。