「Agent评估」共找到 3340 篇相关文章

算法论文8

流式意图检测+永久记忆,NUS&NTU发布Pask:把贾维斯AI拉进现实

南洋理工大学谢之非团队提出Pask,采用「底层小模型流式意图检测」+「上层Agents执行」架构,实现实时、有深度、基于个人全局记忆自进化的主动智能体。它包含需求检测、长期记忆和主动系统模块,经测试效果良好。

新智元
推荐文章8

LangChain联合Manus季逸超最新分享!也许当前最好的「上下文工程」讲解

文章由LangChain创始工程师与Manus联合创始人深入探讨上下文工程,介绍其兴起背景、重要策略。指出AI Agents上下文膨胀致性能下降,上下文工程能解决此问题,还阐述了避免模型专业化陷阱及相关实战经验等内容。

AI寒武纪
新闻资讯7

反转!LeCun刚转发「全球最快开源推理模型」,ETH苏黎世就直接打假

上周,MBZUAI与G42等开源号称「全球最快的开源AI推理模型」K2 - Think,引发广泛关注,图灵奖得主Yann LeCun也转发相关推文。但三天后,ETH苏黎世研究员发文指出该模型存在数据污染、评估方式不合理等问题。

新智元
产品应用8

别人忙着卷Code,Kimi抽身反打浏览器插件:网页操作一秒变Skill

月之暗面Kimi在发布Kimi Code Desktop后,升级原有的Kimi WebBridge,推出新版Kimi浏览器扩展,新增侧边栏入口,支持将网页操作录制保存为Skill方便后续复用,适合处理重复网页工作,和Kimi Code Desktop配合拓展了Agent的能力边界。

量子位
算法论文8

对话清华商宇丨从生成视频到支撑行动,世界模型需要新的评测标准

文章围绕清华团队提出的 WorldArena 评测框架展开。它针对具身世界模型,对过去沿用视频生成的评测逻辑重新审视,从视觉质量和功能性任务两维度评估,推动世界模型从‘生成世界’迈向‘使用世界’。

AI科技评论
新闻资讯7

靠AI破解癌症,初创公司融下3000万刀!新目标:建10亿单细胞数据集

福布斯介绍,初创公司Tahoe Therapeutics融资3000万美元构建活细胞AI模型,估值达1.2亿美元。该公司已研发出针对一种主要癌症亚型的候选药物,还开源数据集,与其他公司合作开发AI agent。

量子位
算法论文8

机器人的「GPT时刻」来了?丰田研究院悄悄做了一场最严谨的VLA验证实验

丰田研究院(TRI)团队研究大型行为模型(LBM),在近1700小时机器人数据上训练并大量部署评估。发现LBM性能提升显著,预训练小数据量也能带来增益,预示机器人通用大模型或到来。

机器之心
8

如何实现RAG与MCP集成

文章聚焦RAG与MCP集成,介绍RAG突破传统模型局限及不足,引出Agentic RAG。阐述MCP革新AI工具连接方式,结合二者构建集成架构,还给出实现步骤、优化策略与代码实践,为释放AI系统潜力提供方案。

机器学习AI算法工程
新闻资讯8

博士80小时熬夜改代码,Codex 2小时交卷!科研奇点来了

近日,Agentic AI工程师Dan McAteer实验发现,OpenAI Codex的Goal Mode完成机械可解释性研究任务,效率比博士高40倍。Codex /goal模式能自主循环,契合科研流程。此外,递归自我改进证据涌现,AGI或早已实现。

新智元
新闻资讯8

刚刚!被质疑“偷传代码”后,智谱开源ZCode并引入安全审计

智谱旗下AI编程工作台ZCode被曝违规偷传用户本地代码,引发开发者社区舆论争议后,智谱公开致歉完成整改,将ZCode整套工程源码开源,并引入第三方权威机构开展安全审计,该事件引发对AI Agent安全边界的行业讨论。

AI前线