多模态智能体」共找到 4173 篇相关文章

新闻资讯8

你以为百度慢了,其实它在走一条最难的路

2025 WAIC 上,百度展示多项成果。萝卜快跑获上海牌照、入选‘国家展’,商业化加速;慧播星推 NOVA 数字人技术;飞桨平台等也入选‘国家展’。百度构建全栈架构,把 AI 从炫酷变好用。

MacTalk
开源动态7

Claude Code有救了,这个开源的GUI解决了很多使用验问题。

Claude Code强大但命令行操作不便,缺少历史记录、回滚等功能。开源的Claudia GUI工具解决诸多问题,将命令行转化为图形界面,支持会话管理、检查点回滚等,性能优异且跨平台。

开源AI项目落地
算法论文8

西工大张伟伟团队:大模型时代航空科技的蓝图畅想 | 航空学报CJA

随着国产开源大模型涌现,大语言模型走入生活,挑战传统航空教育,革新科研范式,与航空产业融合推动变革。西工大张伟伟团队探讨其在航空工程教育、科研、行业全链条的影响及挑战。

力学与人工智能
新闻资讯8

Sam Altman最新博文!温和的奇点

OpenAI CEO Sam Altman在新博客《The Gentle Singularity》中探讨AI进步远超想象时世界的变化,提及AI将在多方面做贡献,还给出未来几年AI发展预测,指出要解决安全和对齐问题。

AI工程化
推荐文章8

Sam Altman 最新文章:悄然而至的奇点,一场温和的革命

Sam Altman在《The Gentle Singularity》中指出,人工智能的“技术奇点”正以温和方式开启,是渐进过程。越过临界点后社会将巨变,解决“对齐”问题、确保技术普惠,人类将迎美好未来。

宝玉AI
算法论文8

首创像素空间推理,7B模型领先GPT-4o,让VLM能像人类一样「眼脑并用」

当前主流视觉语言模型(VLM)依赖文本token间接翻译视觉信息,缺乏直接视觉操作能力。滑铁卢大学等团队提出「像素空间推理」范式,让VLM能像人类一样「眼脑并用」,在四大视觉推理基准测试中,7B的Pixel - Reasoner表现碾压GPT - 4o等。

量子位
算法论文8

纯靠“脑补”图像,大模型推理准确率狂飙80%丨剑桥谷歌新研究

剑桥、伦敦大学学院和谷歌团队推出基于强化学习的视觉规划(VPRL)新范式,纯靠图像推理。新框架利用GRPO后训练,准确率达80%,超文本推理至少40%,代码已开源。

量子位
开源动态8

通义实验室新研究:大模型自己「扮演」搜索引擎,提升推理能力无需搜索API

阿里通义实验室开源ZeroSearch,提供无需与真实搜索引擎交互的强化学习框架。它用模拟搜索环境和渐进式抗噪训练,让LLM自给自足,节省API成本,在多问答数据集表现优,为智能化检索提供新思路。

量子位
开源动态8

DeepSeek-R1发布后的100天复现之旅方法总结

DeepSeek团队发布「推理大模型」DeepSeek-R1 ,其技术细节未完全开源,全球研究团队开启“复现竞赛”。论文总结100天复现经验,介绍推理大模型与普通大模型区别、复现方法、关键发现及未来方向。

深度学习自然语言处理
新闻资讯8

NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026

本文整理了NVIDIA Research科学家李柏依在ECCV 2026 Workshop的分享,针对机器人训练数据采集壁垒高的问题,介绍了两项解决多模态感知与灵巧操作数据难题的前沿研究。

AI科技评论