「深度多模态整合」共找到 1871 篇相关文章
以小博大,仅1.7B媲美gemini2.5-pro,达到SOTA文档解析性能
dots.ocr是多语言开源文档解析器,把布局检测和内容识别统一在视觉语言模型中,虽LLM仅1.7B参数,却达SOTA性能。介绍了其预训练三阶段及SFT阶段关键策略。
你以为百度慢了,其实它在走一条最难的路
2025 WAIC 上,百度展示多项成果。萝卜快跑获上海牌照、入选‘国家展’,商业化加速;慧播星推 NOVA 数字人技术;飞桨平台等也入选‘国家展’。百度构建全栈架构,把 AI 从炫酷变好用。
DeepSeek推理最高提速6倍!开源研究:加装「思维进度条」,计算量减少30%
特拉维夫大学团队开发新方法,给LLM推理任务装进度条,控制推理深度和速度。提出“思维进度向量”TPV预测推理位置,干预TPV可“超频”“降频”,模型已在GitHub开源。
Claude Code有救了,这个开源的GUI解决了很多使用体验问题。
Claude Code强大但命令行操作不便,缺少历史记录、回滚等功能。开源的Claudia GUI工具解决诸多问题,将命令行转化为图形界面,支持会话管理、检查点回滚等,性能优异且跨平台。
o3绞尽脑汁仅答对40%的题目,开源模型基本乱猜?MMSI-Bench:多图空间智能试金石
文章介绍了MMSI - Bench,这是用于评估MLLM多图像空间推理能力的VQA基准。它人工构建样本、全面分类任务、采用多样真实数据。实验显示MLLM在多图像空间推理有短板,还开发自动化错误分析流程助力改进。
首创像素空间推理,7B模型领先GPT-4o,让VLM能像人类一样「眼脑并用」
当前主流视觉语言模型(VLM)依赖文本token间接翻译视觉信息,缺乏直接视觉操作能力。滑铁卢大学等团队提出「像素空间推理」范式,让VLM能像人类一样「眼脑并用」,在四大视觉推理基准测试中,7B的Pixel - Reasoner表现碾压GPT - 4o等。
纯靠“脑补”图像,大模型推理准确率狂飙80%丨剑桥谷歌新研究
剑桥、伦敦大学学院和谷歌团队推出基于强化学习的视觉规划(VPRL)新范式,纯靠图像推理。新框架利用GRPO后训练,准确率达80%,超文本推理至少40%,代码已开源。
哔哩哔哩献给二次元世界的礼物—AniSora,目前最强大的开源动漫视频生成模型
动画视频生成评估挑战大,现有模型处理动画视频力不从心。哔哩哔哩推出AniSora综合系统,支持一键生成多种动漫风格视频镜头,在角色和动作表现上出色,在多维度超越当前先进模型。
DeepSeek-R1发布后的100天复现之旅方法总结
DeepSeek团队发布「推理大模型」DeepSeek-R1 ,其技术细节未完全开源,全球研究团队开启“复现竞赛”。论文总结100天复现经验,介绍推理大模型与普通大模型区别、复现方法、关键发现及未来方向。
ICML 2026现场最全索引:从快手到大厂,中国企业集体出征
ICML 2026 于7月6 - 11日在韩国首尔召开,投稿量翻倍,录用率26.6%。中国企业全面出击,快手、阿里千问等入选多篇论文,现场活动丰富。中国机构研究呈现从发论文到做现场、单点到系统布局、聚焦效率等趋势。