「多模态文本智能」共找到 4455 篇相关文章
来自MIT最强AI实验室:OpenAI天才华人研究员博士毕业了!
OpenAI华人研究科学家陈博远完成MIT博士论文答辩。他不到4年读完博士,辅修哲学,是GPT图像生成核心成员和Sora视频团队成员,将推进世界模型技术,强调视觉世界模型对具身智能至关重要。
LaPha:你的Agent轨迹其实嵌入在一个Poincaré球?
经典强化学习动作空间离散有限,但语言模型动作空间几乎无限。上海科学智能研究院联合复旦大学提出LaPha,将智能体行为树映射到潜空间,构造密集奖励、剪枝等,在基准测试中效果显著。
Karpathy 评 DeepSeek-OCR:分词器必须消失!马斯克:光子才是 AI 的终极语言
Andrej Karpathy 发长文讨论 DeepSeek - OCR 论文,提出图像输入比文本更高效,还表达对分词器的厌恶,认为其必须消失。马斯克称 AI 主要交互将是视觉。开发者分享实践经验,也有人提出质疑。
给几何图片写标题就能让AI更聪明,UIUC发布高质量可泛化几何数据集
随着多模态大语言模型在视觉问答等任务广泛应用,其几何推理能力成研究热点。现有方法泛化能力有限,UIUC团队提出Geo - Image - Textualization框架,发布GeoReasoning - 10K数据集,提升模型几何推理表现。
VerlTool重塑Agentic RL的训练生态
当前LLM像‘缸中的大脑’,缺乏与外界互动能力。新范式ARLT兴起,但构建训练框架面临诸多挑战。VerlTool作为统一、模块化、高效的开源框架应运而生,解决难题,在多任务实验表现出色,推动LLM向智能体转变。
通义团队提出环境Scaling:自动构建环境,并自主学习和成长,可让30B比肩1T效果
阿里巴巴通义实验室团队论文提出通过程序化、自动化构建模拟环境,让语言模型自主交互学习。基于此训练的AgentScaler模型,数十亿参数就达万亿级模型性能,为轻量级代理智能发展带来新可能。
Demis Hassabis揭秘世界模型Genie 3的真正意义:为AGI打造无限“虚拟子宫”
Google DeepMind CEO Demis Hassabis与产品负责人深度对谈,爆料将游戏智能体SIMA放入Genie 3生成世界训练,探讨AI从游戏到思考系统的演进、Genie 3意义及AGI评估挑战,还提及与Kaggle合作推游戏竞技场。
GitHub 推出 AgentHQ,Copilot 生态再扩容
GitHub在GitHub Universe 2025活动上推出AgentHQ,可让开发者在其开发环境创建并部署AI智能体,是Copilot延伸。智能体可处理编码多环节,还与GitHub Actions集成,社区反响褒贬不一。
搜索Agent最新高效推理框架:吞吐量翻3倍、延迟降至1/5,还不牺牲答案质量丨南开& UIUC研究
大语言模型驱动的搜索智能体有能力但效率低。南开和UIUC研究人员剖析效率瓶颈,提出SearchAgent-X框架,实现吞吐量提升、延迟降低,且不牺牲答案质量,还揭示AI智能体平衡和等待问题。
蜂群Agent来了!openJiuwen社区发布JiuwenSwarm,引领Coordination Engineering新范式
华为支持的 openJiuwen 社区发布并开源 JiuwenSwarm,这是面向多智能体协作的蜂群智能体。它指向 Agent 工程新问题,将关注点从 Harness 引向 Coordination Engineering,还介绍了其设计理念、实战效果等。