「LLM式视觉编码器」共找到 1608 篇相关文章
「一只手有几根手指」,你的GPT-5答对了吗?
CMU博士生Tairan He测试发现GPT - 5答错‘一只手有几根手指’问题,指出语言难满足视觉与机器人领域需求,需VLM和VLA模型。编辑部测试发现顶尖大模型面对常识问题也会‘翻车’,还探讨了应对方法。
视听分离SOTA提速6倍!清华发布首个6M高性能模型|ICLR'26
清华大学团队推出Dolphin模型,仅用6M参数,通过离散化视觉编码和热扩散注意力机制,实现单次推理精准分离语音,速度提升6倍以上,在多项基准测试中刷新纪录,为端侧设备部署开辟新路。
用Claude Code剪视频,自动去口癖、加字幕、调色,完全免费开源
browser - use团队开源Claude Code技能video - use,可自动去口癖、加字幕、调色等。它通过转录文本和按需视觉合成图让LLM理解视频,有完整流水线和设计原则,还给出使用方法。
第二代AI预训练范式:预测下个物理状态
英伟达科学家Jim Fan发布文章《第二代预训练范式》指出,当前以LLM为代表的AI模型基于「对下一词的预测」,在物理世界应用中「水土不服」,第二代范式应是「预测下一个物理状态」,引发机器学习社区讨论。
Karpathy 评 DeepSeek-OCR:分词器必须消失!马斯克:光子才是 AI 的终极语言
Andrej Karpathy 发长文讨论 DeepSeek - OCR 论文,提出图像输入比文本更高效,还表达对分词器的厌恶,认为其必须消失。马斯克称 AI 主要交互将是视觉。开发者分享实践经验,也有人提出质疑。
The Batch:927|极速扩散学习
研究表明扩散图像生成器学习重建预训练编码器嵌入可加快训练,Apple团队提出的FAE,通过缩小嵌入再重建解决了因嵌入尺寸大导致的训练受阻问题,性能与先进模型相当且训练更快。
别再乱调图像塔了!浙大 IJCAI 论文揭露 VLM 非对称性真相,给 CLIP 微调「踩刹车」
浙大陈静远教授课题组等提出自适应非对称适配器,放弃对图像分支硬性微调,引入预测置信度自动给视觉塔‘踩刹车’。经实验总结出微调三大核心洞察,在多个数据集测试中表现优异。
AI打假AI,拿下SOTA丨厦大&腾讯优图
厦门大学联合腾讯优图实验室团队提出AIGI - Holmes方法,创新性采用“大模型+视觉专家”协同架构,解决现有AIGI检测技术瓶颈,在检测、解释能力及鲁棒性评估上均取得最优效果。
Bengio 15 年前论文再夺 AAAI 奖!AI 正告别单纯炫技,走向真实世界
全球人工智能顶会AAAI揭晓年度奖项,Yoshua Bengio 2011年论文获经典论文奖。今年5篇杰出论文研究方向指向AI从炫技走向应用,如ReconVLA改进VLA视觉感知,CADYT解决连续时间因果结构学习空白等。
CVPR 2026 Workshop征稿|第六届AdvML@CV:多模态大模型智能体安全
IEEE/CVF 计算机视觉与模式识别会议 CVPR 2026 6月3 - 7日在美国丹佛举办,期间6月3或4日将举办第六届对抗机器学习计算机视觉研讨会,聚焦视觉 - 语言智能体安全,现开启论文征稿并公布重要日期,给出投稿入口。