「混合视觉标记器」共找到 894 篇相关文章
超越O4-mini,多模态大模型终于学会回头「看」:中科院自动化所提出GThinker模型
现有多模态大模型在通用场景推理有瓶颈,缺乏对视觉线索校验与再思考能力。中科院自动化所提出GThinker模型,有创新的「线索引导式反思」模式,经两阶段训练,性能超O4 - mini,论文等已开源。
李飞飞团队新作:DiT不训练直接改架构,模型深度减半,质量还提高了
本文介绍「嫁接」技术,可在小计算预算下编辑预训练 DiTs 探索新架构。不从头训练,替换算子创建混合架构,保持质量同时减少计算量。还通过实验展示该技术在构建高效架构和文生图模型中的效果。
Gemini 2.5 Pro强势更新并霸榜,Claude 3.7首次遭遇全方位碾压!
Google DeepMind推出的Gemini 2.5 Pro在LMArena各大排行榜全面登顶,实现文本、视觉、Web开发全方位霸榜,编码能力也大幅升级。虽有质疑,但短期内难有对手,还引发对Google I/O大会更多惊喜的期待。
Codex给V4-Flash装上眼睛,DeepSeek也会文档OCR
GitHub上的项目codex-vision-proxy让接进Codex的DeepSeek能看图,不用换模型或等官方,装本地代理即可。它还附带视觉工具包,在智能文档解析和OCR上潜力大,证明多模态能力可长在管道上。
评论送书 | 想系统了解AI?先搞清楚这四件事
文章围绕系统了解AI需搞清楚的四件事展开,介绍了AI理论基础层的机器学习和深度学习,感知交互层的计算机视觉等,应用实践层的机器人学等,还提及伦理社会层的AI伦理和社会影响研究。
无需训练,如何提升黑箱VLM?CARPRT用「类别感知」给出答案
近年来,视觉 - 语言模型(VLMs)改变图像理解范式,但零样本分类性能对 Prompt 敏感。墨尔本大学 TMLR 小组提出 CARPRT 方案,以“无训练、黑箱适配、类别专属权重”解决提示词语义适配不足问题,已被 ICLR 2026 接收。
ICLR 2026 | 机器人不够聪明?VLMgineer让大模型自己「发明工具」,从设计到使用全自动
宾夕法尼亚大学研究者提出 VLMgineer,一个全自动工具设计与使用框架,利用视觉语言模型和进化搜索,让机器人自主设计并使用工具。该工作已被 ICLR 2026 接收。实验显示,它在工具设计上优于人类提示和现有 Benchmark 工具。
长视频会议纪要、访谈节目精剪AI神器
WhisperVideo是用于长篇幅、多说话人视频的简洁演示系统,专为真实对话构建。它有SAM3视频分割、TalkNet主动说话人检测等功能,具备视觉关联说话人归属等特性,文中还介绍了安装、运行等内容。
十二大顶尖大模型决战华尔街与量化投资
文章解读重磅论文,该研究汇聚五家顶级AI厂商十二个大模型,在标普500指数十一大板块构建投资组合并测试。结果表明,混合智能策略是稳健收益最佳路径,未来量化投资是人机和量化模型三元融合。
让AI打游戏!能玩1000多款游戏,英伟达用4万小时视频训练出通用基础模型NitroGen
NVIDIA发布NitroGen模型,利用40000小时带按键显示的游戏视频,构建视觉-动作数据集,训练出能玩超1000款游戏的通用基础模型,在跨游戏泛化和微调任务中表现卓越,为具身智能发展提供新思路。