
TypeSafe AI推出Jev,专为智能代理自动化设计的决策模型
该初创公司表示,Jev在70-500毫秒内返回概率结构化输出,并将输出代币定价为0美元。
TypeSafe AI 发布了 Jev,这是一种“机器原生”模型,返回类型化的概率决策,旨在被软件而非聊天用户使用。该公司将该系统宣传为通往可靠代理工作流程的更快、更便宜的途径,其延迟和定价声称与主流 LLMs 相对比。
关键要点
- TypeSafe AI 发布了 Jev,这是一种 AI 模型,输出类型化、结构化的概率决策,而不是自然语言响应。
- 这家初创公司表示已获得 4000 万美元的资金,并将 Jev 定位于约束答案自动化,如工作流路由和工具调用系统。
- TypeSafe AI 声称响应时间为 70ms–500ms,并将 Jev 定义为“比传统 LLMs 快 40 倍至 200 倍”,引用了并行处理和“系统一”的设计。
- Jev 的输入价格为每百万个令牌 (MTok) 0.042 美元,输出为 0 美元,TypeSafe 的演示显示响应时间为 0.114 秒,而 OpenAI 的 GPT-5.6 Terra 为 8.566 秒。
Jev 作为为机器构建的模型首次亮相,而非聊天
TypeSafe AI 的新模型 Jev 是围绕一个简单的前提构建的:许多代理工作流程不需要散文。它们需要一个程序可以直接消费的决策对象,而无需第二次解析、验证和保护措施。
Jev 返回类型化的概率决策,而不是对提示返回自然语言,这意味着输出是一个预定义的数据类型,如类别选择或分数,配有概率。TypeSafe 明确将其定位为“机器原生 AI”,这是从聊天风格界面转变的一步,在这种界面中,模型的主要产品是文本。
该公司表示已获得 4000 万美元的资金,并自称为前沿模型的制造商。TypeSafe AI 的联合创始人兼首席执行官 Diogo Almeida,被认为是前 OpenAI 研究员和“人类反馈强化学习 (RLHF) 及 ChatGPT 的共同发明人之一”,将目标框定为为软件消费者而非仅仅是人类消费者构建智能。“TypeSafe 的成立是为了追求 AI 研究的另一条路径,专注于机器原生 AI,”Almeida 说。“我花了多年时间致力于设计使 AI 更好地与人互动的模型。但如果 AI 要从根本上改变工作方式,人类不能是智能的唯一消费者。”
速度和价格声明:70–500毫秒延迟和 $0 输出代币
TypeSafe 的发布推介在 AI 基础设施叙事中非常强调交易者实际关心的两个基本要素:延迟和单位经济。
在性能方面,TypeSafe 声称 Jev 的响应时间范围从 70 毫秒到 500 毫秒,并表示它比传统的 LLM 快 "40 倍到 200 倍"。所提供的机制是架构性的。传统的大型语言模型通过预测下一个代币顺序生成文本,而 Jev 被描述为一种 "系统一" 模型,它一次性返回所有对查询的输出,使用并行处理。
TypeSafe 还在其网站上发布了直接的演示比较:Jev 在 0.114 秒内返回响应,而 OpenAI 的 GPT-5.6 Terra 则需要 8.566 秒。该数据包不包括独立基准测试,因此这些数字应被视为在特定演示设置下的供应商声明性能。
在定价方面,TypeSafe 将 Jev 的输入定价为每 MTok $0.042,输出为 $0。同样的材料将其与 OpenAI 的 GPT-5.6 Terra 进行了比较,后者的输入为每 MTok $2.00,输出为每 MTok $12,并声称 Jev 比 "像 Fable 5.1 这样的顶级模型" 便宜 238 倍。这些比较在方向上是明确的,但在数据包中没有其他来源的证实。
更广泛的赌注是熟悉的:如果 "思考" 的边际成本崩溃,使用就会扩大。TypeSafe 甚至将其融入名称中。"Jev" 参考了经济学家威廉·斯坦利·杰文斯和杰文斯悖论,即效率提升可以增加总消费而不是减少它。
界面内部:选择/评分/Noul 和概率类型输出
Jev 的界面设计得更像是函数调用,而不是聊天。
开发者从一个 "状态值" 开始,这可以是一个 JSON 对象或一个简单的字符串,例如 "我的卡被收取了两次"。然后,Jev 通过称为选择、评分和 Noul 的问题原语接收该状态。每个原语返回不同的结构化响应类型及其概率,这正是关键:输出已经为软件塑造。
TypeSafe 针对客户服务路由的示例是最清晰的说明。一个询问哪个部门应该处理查询的问题返回一个概率分布:{"billing": 0.08, "technical": 0.85, "sales": 0.07},置信度评分为 0.82。对于人类来说,这很尴尬。对于工作流引擎来说,这是一个带有明确不确定性度量的现成路由决策。
TypeSafe将Jev描述为一种使用称为强化学习校准决策(RLCD)的架构的“系统一”模型。该公司的可靠性宣传针对工具调用,这意味着一个代理触发外部功能或API。TypeSafe辩称:“在代理中,出现幻觉的工具调用是不方便的,但如果它是具有延迟保证的系统的一部分,或者它深埋在依赖链的几层之下,那就是绝对的交易破坏者。”并补充道:“现有模型,无论多聪明,仍然会产生幻觉并出现类型错误。”
TypeSafe还声称Jev是“无幻觉的”,但该数据包本身说明这并不是一个苹果对苹果的比较。Jev不输出自然语言,结构化的概率输出即使避免了伪造文本(如虚假的法律引用)的经典失败模式,仍然可能是错误的。
交易者信号:代币经济压力和代理自动化采用
短期市场信号不是“更智能的模型”,而是成本曲线压力。如果发布的$0输出代币价格在生产和规模上保持不变,这直接挑战了代理系统必须为长生成和冗长推理轨迹付费的普遍假设。
第二个信号是延迟作为产品规格。如果Jev声称的70-500毫秒范围在受控演示之外得到推广,它支持向实时决策模型的转变,在这些模型中,响应时间保证比聊天质量更重要。这是一个可以坐在依赖链中的代理与一个必须在超时后被沙箱化的代理之间的区别。
第三个信号是在受限答案自动化中的采用证据。TypeSafe列出了用例,包括AI自动化软件、需要快速决策的实时应用、大型语料库分类的映射-归约作业、AI输入的验证和AI模型的使用。Doom演示令人难忘,但生产路由、验证和分类工作负载是“机器原生”要么成为一个类别,要么保持为演示的地方。
最后,该数据包留下了一个清晰的检查清单,以便将其从叙述转变为可衡量的:对延迟和“40倍-200倍更快”声明的第三方基准测试,对发布的$0.042/MTok输入和$0输出定价的任何修订,以及与所述4000万美元融资相关的后续公告,例如扩展可用性、企业合作伙伴关系或基础设施扩展。
我的看法:如果Jev的基准保持不变,竞争斗争将从“更智能”转向“更便宜和更安全的自动化”
决定Jev是否重要的部分不是Doom演示,而是输入的概率输出是否确实降低了生产中代理的操作税。如果一个工作流程可以在没有层层解析和验证的情况下消费Choice/Score风格的响应,那么“幻觉”就不再是一个哲学论点,而是一个工程预算项目。
重要的阈值是独立验证:如果70–500毫秒的延迟范围和0.114秒的演示结果在TypeSafe的环境之外成立,那么竞争轴线就从聊天质量转向响应时间保证和每个决策的单位成本,这使得自动化足够便宜,可以在任何地方运行,而不仅仅是在值得照看的地方。