知识工作的大量成本,发生在答案出现之前:辨认关键事实,在几种解释之间分配注意力,决定下一步查什么。报告完成之后,新的披露、判决或实验结果又可能使其中某个判断失效,研究仍需继续。
这些工作依赖一种专业直觉:知道什么值得注意,什么需要怀疑,什么已经足够。我们称之为 taste。Jev 以选择、评分和概率的形式直接给出判断,低成本、低时延使这种直觉有机会进入研究的更多环节。
Jev Cowork 围绕两个尺度展开:在一个问题内部,扩大证据与关系判断的覆盖;沿着时间,持续维护假设、接收变化、推进调查。我们将这个方向称为 Inclusive Intelligence:让更多信息得到考虑,让更多问题获得可负担的、持续的研究关注。
1. 判断与预测:System 1 的两种能力
本文用 System 1 指直接给出有界判断、无需展开显式思维链的模型调用。我们测试的是 jev-1.13.0 的结构化接口。[1]
System 1 描述的是能力被调用的方式:快速、直接,无需每次展开完整论证。它可以用于预测,也可以用于判断。这两种能力的区别,需要从任务本身理解。
预测关心结果:给定当前信息,未来会发生什么,各有多大概率?判断关心取舍:给定目标、证据和约束,什么值得相信、关注或采取? 本文用行动选择测试后者,再把它延伸到研究中的注意力分配。
两者共享知识,却有不同的成功条件。一个人可能看准需求增长,仍选错资金方案;也可能无法精确预测市场走势,却能识别某个方案违反流动性约束,或判断哪条证据值得优先核查。对世界的把握与对行动的取舍,需要分别检验。
| 能力 | 核心问题 | 主要评价依据 |
|---|---|---|
| 预测 | 哪些结果会发生,各有多大概率? | 结果揭晓后的概率误差与校准 |
| 判断,本实验以行动选择为例 | 在这些目标和约束下,应选什么? | 约束满足、目标取舍与行动质量 |
输出长度也无法区分它们。一个概率可以承载复杂的预测,一个选项可以承载复杂的专业判断。Taste 尤其体现在几种“都有道理”的选择之间:哪些条件不可违反,哪个例外真正适用,一个可执行的方案是否值得优先采取。
给定情境中的行动判断
Hard Pro 包含金融、法律和医疗三个领域的九个案例,每题十二条记录、五个候选行动,要求模型综合跨记录约束、时间关系与方案成本作出选择。题面与作者标准在运行前冻结,模型不使用检索或工具。结果如下。

Jev 的表现与 Hunyuan 3 no_think、Cogito-32B direct 相同,比 DS none 和 GLM low 少一题,Gemini 3.6 Flash 为 7/9。BERT-MNLI 将各个行动分别转成蕴含判断,得到 2/9。局部语义匹配与专业行动选择之间,存在明显距离:后者需要把散落在材料中的条件组织成一个整体。
更难的金融题也暴露了这种直觉的局限。Jev 与 DS none 都是 0/3,DS max 为 3/3。其中一道资金安排题,Jev 选中了可执行但成本更高的方案。局部条件的识别,与全局取舍的完成,是两层能力。
时延则呈现出另一种差异。Jev 主行动请求的中位耗时为 0.846 秒,DS none 为 1.887 秒,DS max 为 9.004 秒。这是实验链路上的观测值。对需要反复发生的局部判断,亚秒级响应已经具有实用意义。
未知结果的概率预测
行动选择之外,我们还测试了历史事件预测。六条路线共同成功的七道财经题中,Brier 分数如下,越低越好。
| 路线 | Brier 分数 |
|---|---|
| DS V4.1 Flash max | 0.05347 |
| Gemini 3.6 Flash,thinking budget 0 | 0.09671 |
| GLM-5.3-Flash low | 0.11794 |
| DS V4.1 Flash none | 0.13233 |
| Hunyuan 3 no_think | 0.14357 |
| Jev | 0.15239 |
Jev 在这组预测上落后于其他路线。与前面的行动实验合看,我们得到一幅更具体的能力画像:它能够处理一部分专业约束与行动取舍,对未知事件的概率估计则相对较弱。两组实验各自测量一个侧面,不能彼此代替。
这个差别对 System 1 同样成立。快速识别情境中的关键结构,与快速给出校准的概率,需要学会不同的映射。能直接选出一个合适行动,并不保证能准确分配各个未来结果的概率;接口返回了置信度,也仍需单独检验其校准。[2]
另一个十二题实验中,先由 DS 生成摘要、机制解读或证据审计,再交给 Jev,没有降低相对直接 Jev 的平均 Brier 误差。 解释增加了什么,与这些信息是否改善概率估计,是两个需要分别回答的问题。
判断与预测的协同
真实决策常常同时需要预测和判断。预测提供可能的结果,判断决定如何看待收益、损失与约束。同样的结果概率,面对不同的资金期限或失败代价,可以导向不同的行动。若行动会改变结果,预测本身也要随行动条件而变化。
Hard Pro 将规则和关键条件放进题面,使我们可以较直接地观察取舍能力。开放式研究还要更早做一次判断:缺少什么信息,哪个不确定性重要,接下来值得为它付出多少调查成本。此时,taste 参与决定预测和推理应该用在何处。
这给 Jev 的系统角色提供了一个具体入口。即使系统暂时无法准确预测某家公司下一年的利润,它仍可能识别一段重要披露、发现两个口径之间的张力,或提示一个假设值得重看。我们接下来的实验,检验这些判断能否改善研究过程。
2. 判断的边际成本
当一次专业判断足够便宜,研究的组织方式就有了新的选择。
按实验使用的每百万输入 token 0.042 美元标价,每次两千 token,一万次判断的输入费用约为 0.84 美元。Jev Cowork 的一组研究实验进行了 934 次独立 Jev 调用,输入约 256 万 token,输入费用估算约 0.108 美元。综合模型、检索与复核成本另计。
这一量级允许我们细化判断的对象:一条材料的重要性,两条证据的互补关系,一个结论的适用范围,一次新披露对旧假设的影响。它们可以分别计算、并行发生,并作为研究状态保留下来。
这里的 scaling 增加的是不同判断的覆盖。十次相同提问仍可能停留在同一个盲点;十个新的证据关系,可能打开另一条调查路径。规模的价值取决于新增判断带来的信息增量。
知识工作始终受注意力约束。研究者会优先照顾最紧迫的几个问题,其余疑点、弱信号和长期假设只能等待。低成本判断提供了一种扩展关注范围的可能:让更多材料先被看见,让更多联系先被提出,让一些暂时无人重读的问题继续接受新信息。
Inclusive Intelligence 包含两层含义。研究内部,更多证据与解释获得被考虑的机会;研究之外,更低的维护成本有望使小团队和个人也能持续照顾较大的问题集合。Jev Cowork 用深度研究与连续研究,分别探索这两种可能。
3. 向深处:扩大证据与关系的覆盖
Jev 判断哪些材料值得一起读、哪里存在限定与反证;代码将这些关系组织成议程,综合模型结合完整原文形成带引用的报告。
从找到材料到形成论证
证据检索实验覆盖 380 份完整文档、90,041 个原文片段。

金融目标页 Hit@20 从词面检索的 0.107 提高到 Jev 排序的 0.929,同轮 DS max 为 0.893。Jev 在法律文档排序上也领先,但正例覆盖仍由 DS max 领先。
找到材料并不等于完成论证。在 SVB 与 Akorn 的六个研究问题上,Jev 证据组合加 DS max 的来源复核评分为 78.33/100,完整证据直接 DS max 为 90.83/100。筛选可能丢掉定义和表头,因此报告生成保留完整原文,让议程引导阅读,而不是代替来源。
直觉提出联系,原文约束结论
在 3M 与 Waterkeeper 的四个研究任务中,512 次不同的 Jev 关系判断形成议程,由 DS medium 结合完整原页完成写作。
| 3M / Waterkeeper,四个任务 | Jev 议程 + DS medium | 纯 DS max | 纯 DS none |
|---|---|---|---|
| 研究任务成功 | 3/4 | 3/4 | 2/4 |
| 关键事实核验 | 20/20 | 20/20 | 15/20 |
| 预声明重大错误 | 0 | 0 | 1 |
| 已审引用支持 | 60/61 | 57/59 | 38/49 |
| 写作输出 token,含推理 | 49,993 | 67,512 | 11,137 |
| 平均写作耗时 | 55.9 秒 | 72.4 秒 | 14.6 秒 |
引用采用模型辅助来源复核。token 为四题合计,时间为单次 DS 写作请求均值,议程构建与研究评测另计。
议程加 medium 与纯 max 的任务成功和关键事实核验持平,两者各有一份法律报告因引用编号错误未通过交付。前者写作输出 token 少 25.9%,平均耗时少 22.7%;四份议程的 Jev 构建费用按标价估算约 0.0624 美元。这是议程与较低推理档位组合后的表现。
这些数字之外,报告还留下了可以继续调查的问题。3M 的每股收益小幅上升,但调整后盈利与现金流走弱。报告没有停在“盈利质量下降”,而是把原材料、汇率的影响与销量、价格、生产率放在一起,追问下降中有多少可能随外部条件缓解,有多少来自经营本身。如果主要是暂时性的成本压力,对持续盈利的判断可能缓和;如果销量与单位盈利也持续走弱,就需要进一步检查剩余业务的经营表现。后续研究因此有了具体对象,而不只是“继续关注财报”。
Waterkeeper 案例中的联系来自同一判决的不同页面。一处写到当事人没有承认水体的相对永久性,但也没有直接争执这一事实;另一处则写到它反驳了对方关于“永久长存水体”的主张。把两段放在一起,报告提出了一个核查方向:回到审前陈述和庭审记录,确认哪些自然事实已被承认、哪些仍有争议。这关系到新法律标准下还需要补充什么证据,也影响后续审理可以围绕哪些问题展开。
信息增量来自已有证据被联系起来。 原材料没有增加,但分散的事实被组织成了需要区分的解释、需要补齐的前提。议程在这里提供的是研究线索,而不是直接给出答案。接下来还需要安排顺序:先查哪个问题最可能改变结论,哪些检查依赖前一步的结果,什么证据出现后就可以停止追问。
4. 沿时间:让研究继续发生
报告中的判断通常具有条件性:“公司仍在优先保留资本”“结论依赖某项监管条件”“需要观察下一季度的现金流”。这些条件很少被单独维护。新信息到来时,研究者需要重新找到旧判断,再建立联系。
Jev Cowork 将简报中的发现保存为工作假设,记录复核条件,让后续材料与它们持续匹配。值得关注的变化产生提醒,调查取得的证据进入同一份档案。
CVS:资本配置假设的更新
2020 年末,CVS 仍有较大的未用回购授权,但第四季度没有执行回购。研究者据此保留一个资本配置假设:公司是否仍在优先保留资本?
后续 2022 年报披露了约 35 亿美元的实际回购。系统把这条新材料连接到原有假设,提出复核提醒:回购已经恢复,资本配置判断值得更新。

研究的基本单位由此扩展为问题、假设与证据之间的关系。一份报告留下的判断,可以继续参与后续研究。
持续监测与调查行动
连续研究实验覆盖八个公司或法律主题,底库 397 份完整文档,每案 256 条候选材料、96 条时序更新,分别测试注意力分配、持续监测与调查行动。

Jev 送出的 12 条提醒全部获得来源支持,DS 为 7/12,规则为 2/18。较高的提醒质量让这个入口值得继续探索。不过,Jev 的案例平均及时召回为 37.5%,遗漏仍多,目前适合辅助研究者持续关注。
注意力与调查则更依赖具体的工作流设计。注意力任务在控制通过的六案中,Jev 完整支持 13/24 个问题,规则为 12/24。调查任务中,Jev 为 18/32,规则达到 20/32。Block 案例存在预算内完整取证的路径,Jev 实际行动却只充分支持了四个问题中的一个。
这暴露了连续研究更深一层的需求:系统要记得已经解决了什么、还缺什么,并据此选择下一步。判断之间需要有状态。否则,即使每次调用都便宜,大量局部选择也可能重复消耗在同一个问题上。
5. Jev Cowork:研究协作工作台
Jev Cowork 目前是一个以案例展示为核心的研究原型。 它将前述方法组织成可操作的工作台,便于回放已有结果、观察研究流程,并尝试新的材料。当前实现主要围绕本文案例展开,通用性、稳定性与长期使用体验仍有待完善。
项目仓库:Yii-Jing/Jev-Cowork。
仓库以统一的研究档案连接深度研究与连续研究,串联材料导入、证据组织与假设维护,展示这一协作方式的基本形态。
工作台包含五个相互连接的视图:
| 视图 | 主要功能 |
|---|---|
| 深度研究 | 查看证据关系,组织研究议程 |
| 证据队列 | 检索原文,记录阅读与核验状态 |
| 研究简报 | 阅读带引用的报告,对照来源 |
| 持续研究 | 维护工作假设,接收更新与复核提醒 |
| 调查与笔记 | 保存补查线索、研究记录,导出档案 |
仓库内置两组完整示例。3M 示例包含 136 组保存的 Jev 关系判断,可以对照议程引导与直接综合生成的研究报告;CVS 示例展示资本配置假设如何与后续披露建立连接。两组示例都可在本地回放,查看原文、判断与报告之间的对应关系。
用户可以导入 TXT、Markdown、JSON 或 PDF 材料,创建自己的研究档案。材料、笔记和运行记录保存在本机,档案支持 Markdown 与 JSON 导出、JSON 恢复。开展实时模型分析,需要用户提供自己的 Jev API 密钥;生成研究报告还需配置自己的综合模型 API 地址、模型与密钥。 调用费用由用户所接入的服务收取。
项目采用 Python 3.10+ 与轻量前端,无需 Node 构建,PDF 导入使用可选依赖。未配置 API 时,可浏览保存的示例并使用本地规则整理材料。仓库提供运行说明、模型接入配置、测试及发布脚本,应用代码采用 MIT 许可。
这种组织方式使研究成果能够继续参与后续工作:证据关系进入简报,简报中的发现形成假设,新材料再触发复核与调查。研究档案保留了这一过程的来源与变化。
6. Inclusive Intelligence:初步探索
Jev Cowork 指向一种值得进一步研究的智能形态:专业判断以较低成本广泛分布于工作过程,覆盖更多证据关系,并持续参与问题的更新。我们将它称为 Inclusive Intelligence。
它首先意味着考虑范围的扩展。 一次分析能够容纳多少证据、识别多少相互限制的解释,取决于有限注意力如何分配。低成本的局部判断,有机会让较弱的信号、边缘材料和替代解释更早进入研究视野。信息的价值仍需经过来源核验与整体论证,但被认真考虑的机会可以增加。
它也意味着研究能力的可及性。 持续维护大量问题,通常需要稳定的人力投入。如果判断能够成为轻量、频繁、可组合的操作,个人和小团队就可能以更低成本维持更广的研究覆盖。一个长期问题即使暂时无人主动提问,也可以继续接收相关变化。
这两层含义通过研究状态连接起来。单次判断的价值有限;当它被保存为证据关系、工作假设或复核条件,就能参与未来的判断。深度带来更充分的考虑,连续性保留这些考虑的成果,两者共同构成积累性的研究能力。
本文是对这一方向的初步探索。 现有结果展示了专业判断、证据组织和持续监测中的若干可用成分,也揭示了从局部判断到完整论证、从提醒到有效调查之间的距离。接下来需要在更长时间的真实工作中观察:系统能否减少重要遗漏,改善调查顺序,并让更多人持续开展原本难以负担的研究。
Jev Cowork 为这些问题提供了一个具体起点。直觉发现线索,推理展开论证,原文提供约束,人保留最后的判断。Inclusive Intelligence 所关心的,是这种协作能够延伸到多大的信息范围、多少人的工作,以及多长的时间。
参考资料
- TypeSafe. Jev:模型与定价。
- TypeSafe. Confidence versus Probability。