Datawhale开源 ****开源贡献:Datawhale团队
每个人都在讨论大模型。但在大多数时候,我们让模型做的事情是生成,写一段文案、改一段代码,或者续写对话。 可当你着手构建一个真正的自动化 Agent,或者需要在代码流程里嵌入决策逻辑时,就会遇到另一种场景。很多时候系统并不需要大段长篇大论,只需要在几个有限的候选动作里选一个,或者判断当下的操作是否安全。 为了解决这类高频的判断需求,System One 决策模型应运而生。但真正想要上手时,大家会发现相关资料相当分散。核心论文在 arXiv,技术讨论散落在海外社区,零散的演示代码分布在各个第三方仓库。很多人看完演示效果,依然不清楚第一行代码怎么写、运行环境怎样配置,更不知道如何把模型输出接入现有的工程链路。 做决策这件事,不应该只属于看得懂英文长篇论文的人。 为此,我们梳理并整理了适合中国宝宝的Jev入门教程——《Jev Cookbook》。全书包含 11 章系统讲解与 18 篇可运行的 Jupyter Notebook,带大家从核心原语起步,一步步走向前沿应用与本地决策模型微调。
开源地址:https://github.com/datawhalechina/jev-cookbook`在线阅读地址:https://datawhalechina.github.io/jev-cookbook/`
二、学习指南 我们把 11 章内容整理成五个循序渐进的阶段,帮助大家构建清晰的决策模型开发认知。
基础原语,学会向模型提出一道判断题 教程前三章从 System One 的分工逻辑讲起,拆解 State 状态表示与三种核心问题原语。无论是 Choice 候选单选、Score 序数打分,还是 Noul 是非判断,模型专注于输出选项概率,而业务规则与程序控制流负责校验和执行。
实战配方,把决策接入端到端流程 第四章与第五章准备了 18 篇实战 Notebook,覆盖 RAG 引用过滤、动态工具路由与风险拦截等典型场景。教程还进一步搭建了语音控制的 3D 智能家居演练场,带你拆解从语音识别、意图判定到动作派发的完整耗时链路。
横向评测与交互案例,在真实场景中检验模型 第六章设计了统一的测试基准,横向对比 Jev 与 DeepSeek、豆包、GLM、Kimi 等主流模型。除了观察准确率,更细致记录有效回答率、响应延迟与成本开销。第七章则精选了扫雷、贪吃蛇等 12 个游戏与应用案例,观察模型动作如何在即时反馈中完成决策与执行。
前沿探索,长程记忆与 Agent 显式架构 进入第八章与第九章,教程深入 Jev-Mem 与 JevHarness。在数百轮对话的压力测试中,依靠轻量级的概率判断实现低开销、高准确度的长程记忆检索,并展示如何将决策模型稳妥地嵌入到复杂 Agent 的工具网关之中。
本地实战,从开源权重走向微调与训练 除了云端 API 交互,第十章与第十一章以开源权重模型 Laya 为切入点,带大家在本地搭建推理服务,体验 0 Token 输出与毫秒级的轻量推理,并进一步尝试 SFT、LoRA 与 RLCD-style 训练实验。
在真实的软件工程里,我们常常会面对这类确定性的决策时刻: * 线上突发异常告警,系统需要毫秒级判断是否立刻切断流量 * Agent 在多个工具分支前徘徊,Prompt 写得再长依然难以保证选择稳定 * 面对海量结构化意图,每次都得写厚重的 parser 逻辑来防止格式崩溃 * 业务流推进到关键节点,只需要一次快速的是非定性或风险打分
在这些场景下,程序需要的是快速、稳定且可验证的结构化判断。
希望这套《Jev Cookbook》能成为你的参考,带你系统上手 System One 决策模型。跟着 Notebook 动手跑起来,更欢迎大佬们来一起贡献有关 Jev 的一切! *
开源地址 https://github.com/datawhalechina/jev-cookbook