「Agent评估」共找到 3340 篇相关文章
流式意图检测+永久记忆,NUS&NTU发布Pask:把贾维斯AI拉进现实
南洋理工大学谢之非团队提出Pask,采用「底层小模型流式意图检测」+「上层Agents执行」架构,实现实时、有深度、基于个人全局记忆自进化的主动智能体。它包含需求检测、长期记忆和主动系统模块,经测试效果良好。
LangChain联合Manus季逸超最新分享!也许当前最好的「上下文工程」讲解
文章由LangChain创始工程师与Manus联合创始人深入探讨上下文工程,介绍其兴起背景、重要策略。指出AI Agents上下文膨胀致性能下降,上下文工程能解决此问题,还阐述了避免模型专业化陷阱及相关实战经验等内容。
反转!LeCun刚转发「全球最快开源推理模型」,ETH苏黎世就直接打假
上周,MBZUAI与G42等开源号称「全球最快的开源AI推理模型」K2 - Think,引发广泛关注,图灵奖得主Yann LeCun也转发相关推文。但三天后,ETH苏黎世研究员发文指出该模型存在数据污染、评估方式不合理等问题。
别人忙着卷Code,Kimi抽身反打浏览器插件:网页操作一秒变Skill
月之暗面Kimi在发布Kimi Code Desktop后,升级原有的Kimi WebBridge,推出新版Kimi浏览器扩展,新增侧边栏入口,支持将网页操作录制保存为Skill方便后续复用,适合处理重复网页工作,和Kimi Code Desktop配合拓展了Agent的能力边界。
对话清华商宇丨从生成视频到支撑行动,世界模型需要新的评测标准
文章围绕清华团队提出的 WorldArena 评测框架展开。它针对具身世界模型,对过去沿用视频生成的评测逻辑重新审视,从视觉质量和功能性任务两维度评估,推动世界模型从‘生成世界’迈向‘使用世界’。
靠AI破解癌症,初创公司融下3000万刀!新目标:建10亿单细胞数据集
福布斯介绍,初创公司Tahoe Therapeutics融资3000万美元构建活细胞AI模型,估值达1.2亿美元。该公司已研发出针对一种主要癌症亚型的候选药物,还开源数据集,与其他公司合作开发AI agent。
机器人的「GPT时刻」来了?丰田研究院悄悄做了一场最严谨的VLA验证实验
丰田研究院(TRI)团队研究大型行为模型(LBM),在近1700小时机器人数据上训练并大量部署评估。发现LBM性能提升显著,预训练小数据量也能带来增益,预示机器人通用大模型或到来。
如何实现RAG与MCP集成
文章聚焦RAG与MCP集成,介绍RAG突破传统模型局限及不足,引出Agentic RAG。阐述MCP革新AI工具连接方式,结合二者构建集成架构,还给出实现步骤、优化策略与代码实践,为释放AI系统潜力提供方案。
博士80小时熬夜改代码,Codex 2小时交卷!科研奇点来了
近日,Agentic AI工程师Dan McAteer实验发现,OpenAI Codex的Goal Mode完成机械可解释性研究任务,效率比博士高40倍。Codex /goal模式能自主循环,契合科研流程。此外,递归自我改进证据涌现,AGI或早已实现。
刚刚!被质疑“偷传代码”后,智谱开源ZCode并引入安全审计
智谱旗下AI编程工作台ZCode被曝违规偷传用户本地代码,引发开发者社区舆论争议后,智谱公开致歉完成整改,将ZCode整套工程源码开源,并引入第三方权威机构开展安全审计,该事件引发对AI Agent安全边界的行业讨论。