多模态LLM」共找到 1855 篇相关文章

新闻资讯7

谷歌神秘模型Kingfall泄漏!

近日,谷歌AI模型Kingfall在AI Studio平台短暂开放后意外曝光。它具备多模态处理能力,上下文窗口6.5万个token,有两种模式。生成SVG矢量图能力超Claude 4,身份猜测不断。

AI工程化
算法论文8

Agent 护城河:揭秘Harness的三大支柱

上海交大等机构研究者梳理LLM Agent设计逻辑,指出能力正从模型内部流向外部,外部化有记忆、技能、协议三大支柱,Harness负责协调,Agent竞争转向外部化基础设施。

CourseAI
新闻资讯7

突发!姚顺雨后,清华95后庞天宇加入腾讯,任混元「首席科学家」

继OpenAI大神姚顺雨之后,95后清华博士庞天宇入职腾讯,任混元首席研究科学家,负责多模态强化学习。腾讯AI战略从跟随转向进攻,人才、技术、架构都有新动作。

新智元
新闻资讯7

ICME专题征稿 | 具身多模态智能:从感知到世界建模

ICME是多媒体领域国际顶级会议,2026年将在泰国曼谷举行。此次专题征稿聚焦具身多模态智能,涵盖多模态感知、世界模型等主题,介绍了投稿详情及联系方式。

深度学习自然语言处理
算法论文8

SRO赋能Qwen-2.5-VL推理性能飙升16.8%

文本领域推理模型成就大,但多模态大型语言模型推理能力扩展遇阻,如冷启动初始化不足等。提出SRO三阶段训练框架,经测试,ReVisual - R1平均性能提升16.8%。

CourseAI
新闻资讯7

DeepSeek、GPT、Qwen,所有大模型架构图都有,Karpathy:宝藏画廊!

大模型赛道热闹,架构创新多,理解困难且缺清晰架构图。AI 研究者 Sebastian Raschka 绘制主流大模型结构,整理成在线图谱「LLM Architecture Gallery」,方便研究者查阅对比。

机器之心
推荐文章8

Sebastian Raschka 新书《从头开始推理》抢先看,揭秘推理模型基础

著名AI技术博主Sebastian Raschka新书《Reasoning From Scratch》第一章介绍LLM中推理含义、训练阶段、模式匹配与逻辑推理区别,还讲述提升推理能力方法及从头构建推理模型的重要性等内容。

机器之心
新闻资讯7

不用跟AI客气了!新研究:语气越粗鲁回答正确率越高

宾夕法尼亚州立大学研究《Mind Your Tone》显示,与AI交流时说话越粗鲁,LLM回答越准。测试发现,对GPT - 4o特别客气时正确率80.8%,粗鲁时升至84.8%,但老模型不适用。

量子位
新闻资讯7

商汤新模型 SenseNova-U1 Pro 曝光,对标 GPT-Image-2,瞄准「设计」赛道

商汤科技在股东大会预告下一代旗舰多模态基座模型 SenseNova-U1 Pro,预计 2026 年 7 月邀测,对标 GPT-Image-2,瞄准「设计」赛道,具备多核心能力,还支持 8K 分辨率输出。

AI科技评论
算法论文7

SRO架构赋予Qwen-2.5-VL推理能力,性能飙升16.8%

文本领域推理模型成就大,但扩展到多模态大语言模型遇阻力,如冷启动初始化不足等。为此提出 SRO 三阶段训练框架,经测试,ReVisual - R1 平均性能提升 16.8 个百分点。

CourseAI