多智能体模型」共找到 10833 篇相关文章

算法论文7

AI集体“听不懂”!MMAR基准测试揭示音频大模型巨大短板

MMAR基准测试对30款音频相关模型进行测试,结果显示,数开源模型面对复杂音频推理任务远未达实用水平,音乐任务中所有模型表现不佳,且有显式推理能力的模型表现更优。

量子位
开源动态8

突破传统检索瓶颈!阿里通义实验室发布 WebDancer,开启步推理智能体新范式!

在信息爆炸时代,传统检索技术缺乏动态决策能力,难以满足步推理需求。阿里通义实验室发布的 WebDancer 基于 ReAct 框架,通过四阶段构建,在测试中表现优异,未来规划拓展工具生态、突破任务边界等。

开源星探
产品应用7

Cursor 3 发布:IDE 不重要了,智能体控制台上位,VS Code 这一套开始失效

Cursor 3 发布,用智能体管理控制台取代传统代码编辑器,标志 AI 辅助开发工具与开发者工作流程重大转变。它带来仓库支持、Cloud Handoff 等功能,转型源于竞争压力,业界对智能体编排层架构设计未达成共识。

InfoQ
开源动态8

小红书提出DeepEyesV2,从“看图思考”到“工具协同”,探索模态智能新维度

小红书推出模态模型DeepEyesV2,它延续视觉推理优势,实现代码执行、网页搜索和图像操作的全工具协同。通过工具协同推理解决复杂问题,采用两阶段训练策略,准确率远超开源模型

量子位
算法论文8

AAAI 2026 Oral | 大模型「爱你在心口难开」?深度隐藏认知让推理更可靠

合肥工业大学团队提出大模型存在‘隐藏的真伪认知’,论文让模型用此给推理‘打分’,过滤错误推理链。通过层注意力头探测、构建预测器和新推理扩展策略,提升了推理链稳定性,实验效果优异。

机器之心
开源动态8

以小博大!Nanbeige4-3B重磅开源:硬刚Qwen3,挑战小模型能力新高度

近年来大语言模型参数膨胀,成本升高,业界重注小语言模型。近日,Boss直聘南北阁大模型实验室发布仅30亿参数的Nanbeige4 - 3B,在方面媲美甚至超越通义千问Qwen3系列模型,开源印证小模型潜力。

AIGC开放社区
新闻资讯8

蚂蚁集团领投,光轮智能20亿美元估值引领全球具身数据基础设施|甲子光年

具身智能市场逻辑生变,从关注模型和本体转向数据与评测基础设施。光轮智能获蚂蚁集团领投,估值超20亿美元。其构建完整闭环,参与国际标准制定,打造物理AI教育系统,引领产业发展。

甲子光年
开源动态8

谷歌开源Gemma 3 270M,性能超越Qwen 2.5同级模型

本周四,谷歌发布 Gemma 3 270M 模型,它参数小、功能强,具备指令跟踪等能力。在 IFEval 测试中表现出色,节能且适合场景,谷歌还提供使用指南和试用途径,Gemma 系列下载量已破两亿。

机器之心
新闻资讯7

图灵也没想到,智能,必须在现实中「活」下来

第六届 ATEC 科技精英赛 ATEC2026 已开赛,由单位共同组织。赛事聚焦人工智能、具身智能等方向,以真实世界挑战为命题,通过赛题设计检验系统在真实环境的运行能力,还设置丰厚奖励。

机器之心
新闻资讯7

北大卢宗青:现阶段世界模型和 VLA 都不触及本质|具身先锋十人谈

北大卢宗青作为具身大脑创业者,认为现阶段世界模型和 VLA 未触及本质。他指出互联网视频数据是唯一可规模化的道路,其创立的「智在无界」正标注互联网视频中人类关节动作让模型学习。

AI科技评论