「多模态论文」共找到 1879 篇相关文章
深谋商业化一骑绝尘!人形机器人中标国网电力,大载重eVTOL即将首飞
深谋科技在今年世界人工智能大会上大放异彩,其融合多模态感知检测的人形机器人中标国网河北电力项目,相关技术将应用于关键研究和装置研制。此外,其大载重eVTOL曜眸MX150E无人机即将首飞量产,有望成低空经济出海冠军。
【DeepSeek-OCR系列第一篇】Language Modelling with Pixels【ICLR23】
当前主流语言模型依赖固定词表,扩展到多语言、多脚本时面临覆盖受限、计算昂贵、鲁棒性差等问题。ICLR 2023论文提出不依赖词表的PIXEL模型,通过将文本变成图像用视觉Transformer理解,实验验证其有跨语言、抗噪声等优势。
牛!小米开源「音频语言模型」,超1亿小时预训练时间,音频理解和输出能力是真顶!
小米推出开源音频语言模型MiMo - Audio,有超1亿小时预训练时间。它能理解音频,70亿参数模型在多基准测试达SOTA,音频理解超Gemini - 2.5 - Flash,复杂推理优于GPT - 4o - Audio,还支持多模态任务。
老外傻眼!明用英文提问,DeepSeek依然坚持中文思考
DeepSeek-V3.2和DeepSeek-V3.2-Speciale推理能力显著提升,海外研究者用英文提问,它却用中文思考。评论有两种观点,相关论文显示中文省token但非最有效,大模型选思考语言并非只看效率。
无需标注和奖励模型!仅靠自信度RL,16个样本训练20步,效果飙升21%!
论文提出RLSC,让大语言模型用自身答案置信度作奖励信号,摆脱人类标注依赖。它以模型自信度内部信号替代多数投票外部信号,小成本提升模型数学能力,还让模型学会快推理,不过也存在安全隐忧。
算法1年翻倍,芯片2年翻倍?重磅实锤:AI正在自我加速,拦不住了
NBER论文证明AI研发自我加速反馈环强度远超其他科技领域,芯片效率每2年、算法效率每1年翻倍。部分自动化就能引爆反馈环,全行业13%自动化率或软硬件17%自动化率可触发奇点,6年内AI可能实现自我迭代。
那个刷爆全网的提示词技巧,吴恩达刚官宣:早就过时了!重磅发布2026最新提示词大师课
吴恩达发布《2026提示词工程大师课》,指出过去流行的提示词技巧已过时。课程介绍了成为AI高阶玩家的方法,如给足上下文、引导AI给出真实反馈、用渐进式大纲写作等,还提及AI知识获取、搜索及多模态能力等内容。
读万卷书,大模型就能「看」懂视觉世界?Meta揭秘LLM视觉先验的起源
Meta超级智能实验室与牛津团队新论文发现,只见过文本的大语言模型(LLM)能学到可迁移到视觉任务的先验能力。研究通过超100组受控实验、耗费50万GPU小时,揭开LLM视觉先验来源,还给出预训练数据配方。
4万星开源项目被指造假!MemGPT作者开撕Mem0:为营销随便造数据,净搞没有意义的测试!
高人气开源智能体记忆项目Mem0在论文中称在LOCOMO上打败所有人,MemGPT联合创始人公开指控其测试无意义、数据造假。二者都为解决大模型长期记忆问题,Letta认为能力比工具重要,并给出评估智能体记忆能力的方法。
Reasoning的最终答案可能不是模型想要的答案!
大型语言模型解决复杂问题有推理过程和答案,传统评估只看最终答案。论文提出最终答案可能不佳,中间步骤更值得研究。还介绍通过切割推理过程发现中间步骤藏玄机,提出‘分步检查法’提升模型表现,实验表明准确率最高提升13%等。