「视觉注意力机制」共找到 1566 篇相关文章
句子级溯源+生成式归因,C²-Cite重塑大模型可信度
在人工智能发展背景下,大模型内容可信度成焦点。北邮百家AI与小米团队提出溯源大模型C² - Cite,首创上下文感知归因生成技术,解决现有归因模型缺陷,已被WSDM 2026收录。
全面战胜ReAct!斯坦福全新智能体推理框架,性能提升112.5%
斯坦福和MIT团队推出新AI智能体推理框架ReCAP,在长上下文任务中全面超越ReAct,性能提升显著。它通过独特结构和三大机制解决大模型常见问题,虽成本增加,但在关键任务表现出色,潜力巨大。
Runway Gen-4.5刷屏发布,把重量、尘土和光影都做对了,网友:颠覆
Runway Gen-4.5突袭发布,获“视频生成AGI时刻”评价,在Artificial Analysis测试中拿下SOTA。它能精准执行复杂指令,物理还原与视觉精准度强,官方将逐步开放使用权限,还直言其存在因果推理等局限。
OpenAI发布GPT-5.1 Codex Max,编程能力比Gemini 3更强、更持久
为换回注意力,OpenAI紧急发布GPT - 5.1 Codex Max。它在编程测试中表现优于Gemini 3 Pro,还实现24小时项目级开发。引入自动压缩与扩展推理改进,效率提升,现已多途径可用,API访问将开放。
长达790年视频镜头,打造原生多模态世界模型!北京智源研究院用Emu3.5统一“世界”
北京智源研究院发布并开源基于原生多模态训练的世界学习者Emu3.5,它将视觉和语言视为同一种数据流,在超13万亿token数据上学习,解决长视野多模态信息处理问题,经多阶段训练和优化,能力强大且已开源。
L4大方向有了:理想自动驾驶团队,在全球AI顶会上揭幕新范式
在全球计算机视觉学术顶会 ICCV 2025 上,理想汽车自动驾驶高级算法专家詹锟发表演讲,阐述了‘从数据到训练’的系统化思路,提出将世界模型与强化学习闭环落地于量产自动驾驶系统的完整架构。
从“云原生”到“智能原生”,AI中间件走到哪一步了?
InfoQ直播栏目邀蚂蚁集团专家探讨AI中间件基建,指出其核心价值,如降低开发门槛等。还谈及云原生到智能原生的转变、记忆服务定位、自研必要性等,分析未来挑战与方向,10月上海QCon大会将聚焦相关话题。
重塑你的vlog!PickStyle打造稳定的视频风格迁移模型
Pickford提出PickStyle,这是基于扩散模型的视频到视频风格迁移框架。它结合上下文–风格适配器和CS–CFG机制,能在保持画面连贯时准确迁移风格,还能避免闪烁等问题,不过也继承了基础模型部分缺陷。
让图像生成告别 AI 味!清华 + 港中大 + 腾讯混元联手推出SRPO
腾讯混元联合港中大、清华推出SRPO,解决文生图技术痛点。它结合Direct - Align和SRPO,提升图像审美等,训练时间缩至十分钟,在测试中碾压主流方法,不过对冷门风格控制和机制可解释性待提升。
收手吧GPT-5-Codex,外面全是AI编程智能体!
OpenAI推出专为智能体编程设计的GPT-5-Codex,其在代码重构、审查和缺陷发现上表现提升,具动态资源分配机制。文中还提及Codex起源、Harness概念及OpenAI内部工具,当前编程智能体竞争激烈。