「非线性多智能体推理」共找到 5108 篇相关文章
刚刚,OpenAI拿下IOI金牌,仅次于前五名人类选手!参赛推理模型才夺得IMO金牌
2025年国际信息学奥林匹克(IOI)中,OpenAI推理模型获金牌,在AI参赛者中排第一,得分仅落后5位人类选手。其未专门训练,成绩较去年大幅提升。此前它在IMO也获金牌级别成绩。
不让“猪队友”拖后腿!哈深新作 AgentDropoutV2,专治多智能体“传话游戏”翻车现场
多智能体系统中,常有agent出错带偏整体。哈工大联合阿里提出AgentDropoutV2,测试时介入,设‘质检员’审核输出,结合失败案例构建‘避坑指南’,在多测试中显著提效,泛化性强。
手机AGI助手还有多远?移动智能体复合长程任务测试基准与调度系统发布
上海交大与澜舟科技研究发现现有移动端GUI智能体处理复合长程任务能力不足,提出UI - Nexus测试基准和Agent - NEXUS调度系统,经实验能提升任务完成率,也为AI原生操作系统建立雏形。
自适应Agent基础模型:从“会推理/会用工具”到“懂得取舍的执行者”
当前大型语言模型在智能体/工具调用场景有推理型和工具型两类,存在效率与功能、深度的矛盾。A²FM框架提出多模式自适应路由,实现模式自适应切换,在多基准测试中效果与效率双升。
内存减6倍、精度0损失,推理提速8倍!谷歌新技术震撼了AI圈
Google Research团队推出TurboQuant技术,能将KV缓存6倍压缩、无精度损失,推理速度提升8倍,解决内存瓶颈问题,为大语言模型应用扫清障碍,引发业界关注,还致存储芯片巨头股价大跌。
首个语音智能体端到端测评出炉:Grok登顶,真实场景通过率仅一半
Artificial Analysis推出业内首个语音转语音智能体端到端性能基准τ - Voice,测试真实客服场景能力。结果显示最强S2S模型成功率刚过一半,Grok Voice Think Fast 1.0夺冠,但也面临诸多质疑。
具身智能能力狂飙,安全却严重滞后?首个安全可信EAI框架与路线图出炉!
具身人工智能发展迅速,但能力与安全出现“脱钩”。上海人工智能实验室和华东师范大学团队撰写论文,为“安全可信具身智能”建立理论框架与蓝图,提出成熟度模型、分析框架等。
具身智能的「GPT时刻」?高德连发两个全面SOTA的ABot具身基座模型
过去几年,机器人行业面临模型与数据绑定特定场景、能力难以泛化的问题。近日,高德发布 ABot 系列具身基座模型,补齐行业能力缺口,标志具身智能从定制系统转向统一模型,有望降低开发门槛。
AI 领域新动向!持续思考模型CTM横空出世:AI 向生物智能迈出重要一步
Sakana AI 推出新型 AI 模型 CTM,重新引入「时间」和「神经元动态」到 AI 计算核心。它有诸多创新,在迷宫探索、图像识别等任务表现出色,虽有训练慢等不足,但为 AI 向生物智能迈进提供新思路。
GRPO遭遇瓶颈?G²RPO-A让自适应指导为小模型推理能力「开外挂」
大模型推理能力难迁移到小模型,现有强化学习方法如GRPO在小模型上性能提升有限。香港中文大学(深圳)唐晓莹教授团队提出G²RPO - A算法,缓解小模型奖励稀疏问题,在多模型实验中表现优于vanilla GRPO。