「研究Agent」共找到 4371 篇相关文章
刷新复杂Agent推理记录!阿里通义开源网络智能体超越DeepSeek R1,Grok-3
互联网信息检索中,复杂问题让普通开源模型力不从心。阿里通义实验室提出WebSailor方案,通过SailorFog - QA数据集和DUPO算法等创新,提升模型能力,在多基准测试中超越诸多开闭源模型。
陶哲轩再爆:一个月三破18年未解难题!AlphaEvolve彻底改写数学研究规则
一项封尘18年的数学难题,在短短30天内被AlphaEvolve与人类联手三度突破,和差集指数θ从1.173050提升至1.173077,刷新加法组合学天花板,展示了AI与人类协作的新范式。
Energy | 西工大史子颉、高传强等:三维风力机叶片动态失速数据融合建模研究
动态失速威胁风力机叶片安全与发电效率,传统模型有局限。西工大团队开发数据融合神经网络与动量叶素理论耦合框架,能高效高精度预示三维叶片动态失速,虽部分工况有偏差,但预测精度显著提升。
纯靠“脑补”图像,大模型推理准确率狂飙80%丨剑桥谷歌新研究
剑桥、伦敦大学学院和谷歌团队推出基于强化学习的视觉规划(VPRL)新范式,纯靠图像推理。新框架利用GRPO后训练,准确率达80%,超文本推理至少40%,代码已开源。
通义实验室新研究:大模型自己「扮演」搜索引擎,提升推理能力无需搜索API
阿里通义实验室开源ZeroSearch,提供无需与真实搜索引擎交互的强化学习框架。它用模拟搜索环境和渐进式抗噪训练,让LLM自给自足,节省API成本,在多问答数据集表现优,为智能化检索提供新思路。
说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。
作者有感于AI在真实工作场景评测的稀缺性,以阿里国际站RealReplicaBench评测集为例,介绍电商场景任务,发现多数模型成功率低,其他领域类似,呼吁厂商努力,作者也计划自跑评测更新排名。
Claude 刚刚上线 “群聊Agent”:Karpathy盛赞的交互新范式,还是打工人的“数字监工”?
当地时间6月23日,Anthropic上线Claude Tag,可接入Slack用于多人协同办公。前OpenAI大神Karpathy盛赞其为交互新范式。不过它也引发隐私担忧,且对“套壳产品”不利,或利好开源模型。
国产多模态Agent拿下医学分割SOTA!不用改模型、不加token | 浙大&上海AI Lab
现有医学多模态大模型在分割生物医学图像时存在瓶颈,浙大蔡钰祥教授、上海AI Lab江彦开等人提出IBISAgent框架,将分割定义为多步视觉决策过程,实验显示其在多数据集上大幅领先对比方法。
国产AI营销工具来了!工作流被Agent重构,营销物料一键即出
2026年营销与以往不同,传统营销困境重重,消费者注意力碎片化。巨量引擎推出「品星云AI营销新模式」,贯穿营销全链,有独家生态、硬核技术、体系协同优势,为AI营销产业级落地提供范本。
智能体安全如何保障?首个企业级AI Agent应用评估标准欢迎共同起草
近期OpenClaw走红,AI智能体从“能理解、能生成”走向“能执行、能协作”,但企业面临智能体上线条件判断难题。智合标准中心组织起草《企业级AI智能体应用效能评估规范》,现公开征集起草单位与起草人。