「评估工程」共找到 1392 篇相关文章
Python逆天改命!开源Hermes首次击败OpenAI Codex
纯Python写的开源项目Hermes Agent,在11项基准测试中以6:5战绩击败OpenAI用Rust写的Codex。它通过三大工程优化,将启动时间从701ms降至258ms。这表明在AI Agent领域,架构比语言性能更重要。
对话清华商宇丨从生成视频到支撑行动,世界模型需要新的评测标准
文章围绕清华团队提出的 WorldArena 评测框架展开。它针对具身世界模型,对过去沿用视频生成的评测逻辑重新审视,从视觉质量和功能性任务两维度评估,推动世界模型从‘生成世界’迈向‘使用世界’。
让问题不过夜:交易领域“问诊”Agent实践
文章针对研发支持中的痛点,构建智能Agent系统,将问题抽象为业务答疑与问题诊断两类能力。介绍了系统架构、构建演进、知识体系、质量评估等内容,还展示实战成效,指出当前边界与下一步方向。
从 0 到 1 做一款 AI 产品:技术怎么搭、成本如何控制、销售策略怎么定?
独立开发者 Arvid Kahl 分享从零构建 AI 播客产品 Podscan 及「节俭工程」经验,涵盖技术搭建、成本控制与销售策略调整。如用小众云服务降成本,从 PLG 转向 SLG 等,为小团队创业者提供实用借鉴。
机器人的「GPT时刻」来了?丰田研究院悄悄做了一场最严谨的VLA验证实验
丰田研究院(TRI)团队研究大型行为模型(LBM),在近1700小时机器人数据上训练并大量部署评估。发现LBM性能提升显著,预训练小数据量也能带来增益,预示机器人通用大模型或到来。
从CLI原理出发,如何做好AI Coding
文章从CLI原理出发探讨AI Coding,介绍CLI产品美学、技术原理,比较Single Agent与Multi Agent,还给出用好CLI写代码的建议,如正确认识AI、学习Prompt工程等,最后提及利用通义万相AIGC实现图像生成。
TACL 综述 | 别只卷架构了——长文本模型的能力天花板,其实是数据决定的
该 TACL 综述首次从数据视角审视长上下文语言模型,指出长上下文能力本质是数据驱动。它建立分类体系,明确高质量长文数据条件,给出核心能力的数据配方与评估法,还整理数据集和基准,提出待解问题。
刚刚,Fable-5之下,智谱开源的GLM-5.2拿下AI编程第一!
智谱开源的GLM - 5.2在AI编程领域成绩斐然,在Arena获全球第二、Design Arena全球第一,八项基准测试表现亮眼。经多方面实测,它在长程任务中优势明显,标志国产开源模型进入开发者工作流和硬核工程阶段。
重磅!Anthropic又一个平台级产品炸场:Harness难题一次性解决,把Agent宠物变成牲口
Anthropic推出Claude Managed Agents,一套为云端大规模构建和部署智能体设计的API套件,已在Claude Platform上线公测。它全托管基础设施,专为Claude模型优化,多家企业已在生产环境使用,还同步发布工程博客解释架构设计思路。
和Anthropic CEO一起发过Nature,他用Claude Code复活三年烂尾代码
华盛顿大学首席开发者Brendan MacLean用Claude Code复活三年烂尾代码。他像带实习生一样带Claude,构建上下文让其理解代码库。同一周OpenAI开源Symphony,实现任务自动派Agent。二者路线不同但目的相同,都在探索让AI融入工程流程。