「智能测试平台」共找到 5709 篇相关文章
VerlTool重塑Agentic RL的训练生态
当前LLM像‘缸中的大脑’,缺乏与外界互动能力。新范式ARLT兴起,但构建训练框架面临诸多挑战。VerlTool作为统一、模块化、高效的开源框架应运而生,解决难题,在多任务实验表现出色,推动LLM向智能体转变。
通义团队提出环境Scaling:自动构建环境,并自主学习和成长,可让30B比肩1T效果
阿里巴巴通义实验室团队论文提出通过程序化、自动化构建模拟环境,让语言模型自主交互学习。基于此训练的AgentScaler模型,数十亿参数就达万亿级模型性能,为轻量级代理智能发展带来新可能。
Demis Hassabis揭秘世界模型Genie 3的真正意义:为AGI打造无限“虚拟子宫”
Google DeepMind CEO Demis Hassabis与产品负责人深度对谈,爆料将游戏智能体SIMA放入Genie 3生成世界训练,探讨AI从游戏到思考系统的演进、Genie 3意义及AGI评估挑战,还提及与Kaggle合作推游戏竞技场。
一名员工用个 AI 工具,直接把 Vercel “送”进黑客手里!AI 还在替你决定技术栈,vibe 产品危?
当地时间4月19日,云开发平台Vercel确认内部系统遭未授权访问,黑客出售窃取的数据。攻击源于员工使用的AI平台Context.ai安全事件。此外AI编程助手正重塑技术生态入口,影响工具选择。
GitHub 推出 AgentHQ,Copilot 生态再扩容
GitHub在GitHub Universe 2025活动上推出AgentHQ,可让开发者在其开发环境创建并部署AI智能体,是Copilot延伸。智能体可处理编码多环节,还与GitHub Actions集成,社区反响褒贬不一。
搜索Agent最新高效推理框架:吞吐量翻3倍、延迟降至1/5,还不牺牲答案质量丨南开& UIUC研究
大语言模型驱动的搜索智能体有能力但效率低。南开和UIUC研究人员剖析效率瓶颈,提出SearchAgent-X框架,实现吞吐量提升、延迟降低,且不牺牲答案质量,还揭示AI智能体平衡和等待问题。
蜂群Agent来了!openJiuwen社区发布JiuwenSwarm,引领Coordination Engineering新范式
华为支持的 openJiuwen 社区发布并开源 JiuwenSwarm,这是面向多智能体协作的蜂群智能体。它指向 Agent 工程新问题,将关注点从 Harness 引向 Coordination Engineering,还介绍了其设计理念、实战效果等。
AI开始学会合作?!实测4大多Agent体=10个打工人
Agent热潮进入多智能体时代,多款产品涌现。鲸哥测评了它们在商业计划、运营设计等四大场景表现,总结各产品亮点与不足,指出多Agent正推动大模型向“协作式智能群体”演进。
一夜之间OpenAI神秘模型“o3-alpha”刷爆时间线:远胜 Claude Sonnet
OpenAI神秘新模型“o3-alpha”正在测试,刷爆时间线。早期测试显示其性能超强,能一键生成游戏,前端编码能力远胜Sonnet、o3等。有猜测它是AHC模型或OpenAI将开源的模型。
Dify、n8n、Coze、Fastgpt、Ragflow到底该怎么选?超详细指南~
文章对比了Dify、Coze、n8n、FastGPT和RAGFlow五个主流平台,从功能、使用体验、应用场景等方面详细分析其特点,给出选择建议,还提醒考虑预算、技术能力等要素,帮读者选合适平台。