「多模态论文」共找到 1880 篇相关文章
业界首个高质量原生3D组件生成模型来了!来自腾讯混元团队
腾讯混元3D团队推出业界首个高质量原生3D组件生成模型Hunyuan3D - Part。现有3D生成算法有局限,该模型提出新范式,含P3 - SAM和X - Part,在多数据集评估中超越现有工作,还给出体验地址和论文地址。
2025,大模型文档解析(OCR)年终盘点
2025年6月以来文档解析方法快速增长,有10余种。按“技术路线 + 工程形态”可归为4大类:传统级联流水线、轻量多模态两段式、通用多模态大模型一段式、轻量多模态一段式,各有优劣,4条路线覆盖所有OCR落地场景。
Meta万引强化学习大佬跑路!用小扎原话作为离别寄语,扎心了
Meta万引强化学习大佬Rishabh Agarwal即将离职,用小扎原话“在这个瞬息万变的世界里,最大的风险就是不去冒险”作为离别寄语。他曾参与谷歌、Meta重要模型工作,下一站未明,Meta还有老员工出逃。
综述解读:Memory in the Age of AI Agents
文章围绕《Memory in the Age of AI Agents》展开,指出传统方案难解决Agent长期智能问题,Agent Memory是关键。介绍其形式、功能、动态机制,分析挑战并预测未来方向,为设计记忆系统提供指南。
他们在1993年就提出了Scaling Law
原来,Scaling Law在32年前就被提出了,不是2020年的OpenAI、不是2017年的百度,而是1993年的贝尔实验室。在一篇文章里提出一种预测方法,研究人员可以预测模型在更大数据集上的表现,这和现在大家常提的Scaling Law几乎一致。
谷歌Nano Banana全网刷屏,起底背后团队
谷歌开发者节目展示了Gemini 2.5 Flash Image模型,它能快速生成高质量图像、保持场景一致。文中起底背后团队成员,还介绍模型技术亮点、与Imagen对比及未来能力展望。
跨越技术与法律的壁垒:AI赋能知识产权领域任务全能评测基准IPBench发布
本推文介绍arXiv论文《IPBench: Benchmarking the Knowledge of Large Language Models in Intellectual Property》。论文提出IPBench评估基准,构建含20个任务、10374个双语数据点的基准,评估17个主流模型,揭示现有模型在IP任务中局限。
ICML 2026新规「避坑」指南:参会非必须、原稿将公开、互审设上限
要投 ICML 2026 顶会的需注意新规,如论文被接收作者可选择是否参会,原始投稿版本将公开,互审论文数量受限等。还介绍了投稿要求、重要日期、评审机制等内容。
1/8成本比肩Claude 3.7,Mistral Medium 3来了
“欧洲OpenAI”Mistral AI发布多模态新模型Mistral Medium 3,主打编程和多模态理解,成本仅Claude 3.7的1/8,性能达其90%,API已上线,还推出企业聊天机器人服务,引发网友不同看法。
王兴兴硕士论文惊现GitHub,宇树雏形那时候就有了
宇树科技CEO王兴兴近10年前的硕士毕业论文在GitHub被发现。论文提出电驱式机器人方案,奠定宇树科技雏形。其‘性价比’思想成公司立身之本,如今宇树估值百亿且将IPO。