产品派
返回

Redis作者质疑Jev热潮:多数开发者并不需要

AIInfoQ 中文站2026/9/23 13:02:11
AI 导读

Redis作者Salvatore Sanfilippo于2026年9月21日在社交平台发文,认为围绕新模型Jev的热度被过度放大。相关帖子浏览量已超过11.6万次,他称Jev或许适合少数场景,但与AI领域的其他进展相比只是小事,这种狂热反映出不少人难以区分真正重要的技术与营销话题。

Jev由TypeSafe AI于9月15日发布,创始人Diogo Almeida曾参与GPT-4、ChatGPT及RLHF等项目。它被定义为“System One模型”,不生成文本,而是根据输入,在预设选项中完成分类、评分和判断,并返回置信度。官方称其延迟约70至500毫秒,输入价格为每百万token 0.042美元,输出免费;在公司自建评测中,速度最高快193.6倍、成本低444.6倍。

上线24小时内,Vercel AI Gateway约13%的付费团队已使用Jev;发布36小时后,内测申请覆盖约14万名开发者。相关演示包括网页操作、上下文压缩、邮件分类和Agent工具调用审查。TypeSafe希望让模型成为软件后台的判断组件:代码负责确定性流程,Jev只处理“是什么”“走哪条分支”或“风险多高”等问题。

Jev提供陈述概率、选项选择和标准评分三类原语,核心是把非结构化状态转换为带类型的概率决策。Almeida将其定位为“为软件而生,而非为上帝而生”,并认为RLHF更适合ChatGPT等需要人类参与的助手,不适合无人值守自动化。开发者Theo Browne将Jev比作“聪明的if或switch语句”:适合垃圾邮件识别、工单分流和告警排序,却不具备浏览代码库并完成复杂推理的能力。

官方的193.6倍速度和444.6倍成本优势来自四套内部工作流评测,任务等权计算准确率、成本和耗时,参考标签由GPT-6 Astra与Claude Fable 5.1高推理模式共同生成;TypeSafe也承认评测由内部人员设计,结果可能偏向现实收益的高端。Jev通过放弃自由文本和测试时推理,换取稳定延迟、低价格及并行处理能力。

上下文压缩是争议较大的应用。一名开发者用Jev筛选Claude Code工具调用记录,将约15.6万token压缩至6.2万token,但这可能误删任务目标、历史尝试和决策依据。Jev仅支持32K上下文,也看不到多数模型API不公开的推理数据,误删信息可能导致重复操作或循环;前沿模型已针对上下文压缩进行训练,擅自修改历史记录还可能破坏推理块和提示缓存。

此外,“0%幻觉”主要保证输出格式,而不是答案正确。若限定类别为销售、技术支持、财务和其他,Jev会严格从中选择,不会新增类别、漏字段或破坏JSON;这一比例来自schema约束,并非实际测试得到的准确率。因此,Jev适合作为Agent流程中的低成本分类组件,但不宜负责写代码、压缩复杂上下文,或替代成熟的Harness和前沿模型推理能力。

Jev大模型AI开发Agent模型评测

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文