AI行业又起波澜!前OpenAI成员创业的Jev刚推出便被Laya开源模型超越!
在9月中旬的人工智能开发者社区,一场激烈的技术对抗迅速展开。前OpenAI核心研究员迪奥戈·阿尔梅达(Diogo Almeida)和他的新创公司TypeSafe AI正式亮相,推出了令业界瞩目的决策大模型Jev,声称其决策速度“快得令人难以置信”。Jev专注于系统1决策,即快速直觉反应,将传统大模型在分类与路由中动辄数秒的反应时间压缩至大约200毫秒,迅速引起了技术圈的惊叹。然而,这一封闭源代码的产品光辉却没有维持多久,9月18日,开源团队ConvAI Innovations迅速推出了基于Apache 2.0协议的轻量化决策模型Laya,前者在同样的分类任务下的响应时间直接降至32.8毫秒,相比Jev的响应速度提升了7倍,而且在多语言及长上下文处理能力上全面超越。
阿尔梅达在9月15日的发布会上,为开发者描绘了一个全新的决策模型分支。在他的眼中,现有的大语言模型都在向系统2发展,而很多场景下,尤其是在自动化软件工程、代理编排以及安全防护等领域,80%的工作流根本无需慢速思考,而只是需要快速的系统1判断。因此,Jev专注于处理二元选择、路由以及安全合规等简单任务,旨在消除传统模型处理这些简单任务时的算力浪费。
但就在Jev发布并赢得喝彩的同时,技术社区中出现了不少质疑声。许多开发者认为,Jev与现有对话模型的底层架构其实相近。传统的对话大模型通常依赖自回归生成机制,处理每个Token都需要重复多个推理步骤,因此反应时间较长。Jev则是通过替换原有逐字解码输出层为一个专门针对分类任务的线性输出头,来降低推理时间,并用单次前向计算直接输出结果。这样的改动使得任何现有的基础模型只需轻松调整便可变身为类似决策专精的模型,几乎没有显著的训练成本。
就在这时,Laya模型的发布打破了行业的宁静。由Nandakishor Mukkunnoth带领的ConvAI团队在9月18日发布了完全开源的Laya模型,详尽公开了其架构和权重。Laya基于ModernBERT-large和mmBERT-base构建了高效的决策引擎,其关键功能直击了Jev的核心。Laya在标准评估下的中位推理延迟下降到32.8毫秒,P95延迟保持在42毫秒内,较Jev的200毫秒快了7倍,并且因采用现代多语言表征技术,Laya的多语言意图识别能力在复杂语境中表现更为优秀。
两位游泳新星激战在即,池江璃花子成变数
为企业、学校等团体组织篮球活动、团建训练和赛事,促进团队合作和身体素质提升。...
[无下一篇]
为企业、学校等团体组织篮球活动、团建训练和赛事,促进团队合作和身体素质提升。...