「自动化评估」共找到 1147 篇相关文章
中科院联合清华等发布视觉语言行动推理模型VLA-R1,让机器人先思考再行动
中科院自动化所、清华和GigaAI联合发布视觉 - 语言 - 行动模型VLA - R1,让机器人先思考再行动。它通过构建数据集教模型思维链,结合监督微调与强化学习提升性能,经多场景测试表现出色。
让Agent系统更聪明之前,先让它能被信任
本文从系统工程视角剖析 Agent 系统问题与复杂度,指出开发中‘简单’是假象,复杂性只是被转移。介绍了 Agent 开发各阶段难点,通过案例说明其落地困境,提出将其视为系统组件,先求稳定可靠,还提及开发思路、模式及最新进展。
奥特曼:OpenAI上市,势在必得
OpenAI完成架构重组,为IPO铺平道路。奥特曼公开AGI路线图,预计十年内迈入AGI时代。重组解除盈利上限,可自由增发股票和上市。微软支持转型,双方续约合作。OpenAI在技术、商业等多方面有新进展与规划。
「世界理解」维度看AI视频生成:Veo3和Sora2水平如何?新基准来了
近年来,T2V模型进展显著,Sora2爆火引发对其是否为‘世界模型’的探讨。传统基准无法系统衡量模型对事件因果等的理解,中山大学等团队提出新评测框架VideoVerse,评测主流模型并发现开源与闭源模型差距及各模型缺陷。
协同加速,多机器人协作不再「慢半拍」!软硬一体化框架ReCA破解具身智能落地效率瓶颈
佐治亚理工学院等团队推出集成加速框架 ReCA,针对多机协作具身系统,从算法、系统、硬件跨层协同优化,经评估,实现 5 - 10 倍速度提升且成功率升 4.3%,为具身智能落地奠基。
马斯克“巨硬计划”新动作曝光!从0建起算力集群,6个月完成OpenAI&甲骨文15个月的工作
马斯克“巨硬计划”新动作曝光,6个月从0建起算力集群,完成200MW供电规模。“巨硬”将基于Grok构建多智能体系统,自动化完成软件开发。Colossus II为此提供算力,马斯克亲自督战。
GPT-5爆改时尚圈,让Excel原地复活!OpenAI黑客松大奖出炉
OpenAI举办GPT - 5黑客马拉松挑战赛,95支队伍角逐5万美元奖金。韩国Gentoo团队夺冠,其用GPT - 5开发系统助力商家营销。此外,还有团队将GPT - 5用于时尚、电子表格、知识学习、电脑使用、电网决策等场景。
腾讯开源智能体新框架:不用训练无需充值,用开源模型实现SOTA Agent
智能体框架是推动智能体生态发展的基础设施,但现有框架存在上手门槛高、依赖闭源模型等问题。腾讯优图实验室开源Youtu - agent框架,无需训练模型、不依赖闭源API,性能领先,有多个核心亮点和典型应用案例。
GPT正面对决Claude!OpenAI竟没全赢,AI安全「极限大测」真相曝光
OpenAI和Anthropic罕见合作,测试双方模型在幻觉等四大安全方面的表现。这场合作是AI安全的里程碑,百万用户每天的互动推动安全边界扩展。文中详细对比了GPT和Claude模型在各安全测试中的表现。
当AI接管70%代码审查工作,剩下的30%才是 “地狱模式”
2024年初“Vibe Coding”成热词,其虽能快速验证想法,但在大型企业项目中“不可控性”凸显。亚马逊云科技研发的Kiro,尝试解决“从提示词到生产”的断裂问题。目前代码审查多采用混合模式,AI仅处初级阶段。