语言建模」共找到 1325 篇相关文章

开源动态8

国产王炸!上海AI Lab开源Lumina-DiMOO,开创多模态理解与生成新范式

上海人工智能实验室等多机构推出多模态生成与理解统一模型Lumina - DiMOO,采用全离散扩散架构。它解决传统多模态架构问题,有全离散扩散建模等四大创新,性能在多基准测试中领先,应用前景广。

AIGC开放社区
新闻资讯7

烧钱一年,李飞飞的「空间智能」愿景有变化吗?

在a16z主持的访谈中,李飞飞和Martin Casado探讨「世界模型」等话题,重新介绍World Labs愿景。李飞飞指出语言模型描述3D世界有局限,空间智能是关键,公司已推出相关技术和开源渲染器。

机器之心
算法论文8

把VLM塞进隐式世界模型,小鹏机器人新框架让机器人长出物理直觉

机器人大脑架构中VLM和VAM路线各有短板,香港大学、小鹏机器人等团队提出DIAL框架,让VLM在原生特征空间做隐式世界建模,解耦认知决策与底层执行,在机器人部署中表现优异。

量子位
新闻资讯8

Mistral 发布 OCR 3,提升了手写及结构化文档识别的准确率

Mistral 发布 OCR 3,在多种文档类型上精度更高,超越前一代产品。能提取文本、识别图像并保留文档结构,输出 Markdown 格式。早期用户认可其性能和多语言支持,生产部署扩展快,价格有优势。

InfoQ
算法论文7

预测下一个像素还需要几年?谷歌:五年够了

谷歌DeepMind研究者分析下一像素预测在图像识别与生成任务中的扩展特性。实验显示其扩展趋势与文本类似但效率低,最优策略因任务和分辨率而异,预计未来五年逐像素建模可行。

机器之心
算法论文8

唯快不破:上海AI Lab 82页综述带你感受LLM高效架构的魅力

语言模型性能提升但成本高,制约落地应用。上海AI Lab联合多家机构总结440余篇论文,形成82页综述,将LLM高效架构分为7类,探讨最新进展,还涉及线性化技术、硬件实现等内容。

机器之心
算法论文8

3D-R1:让AI理解3D世界的下一步

文章介绍新研究3D - R1,它是更通用、具推理能力的三维视觉语言模型,解决了当前3D VLM空间理解不足与推理能力薄弱问题,在多任务测试领先,有广阔应用前景。

机器之心
算法论文8

AI自己给自己当网管,实现安全“顿悟时刻”,风险率直降9.6%

大型推理模型有安全风险,此前监督微调泛化能力有限。SafeKey团队提出创新的SafeKey框架,发现大模型信息“越狱”两大核心,通过双通路安全头和查询遮蔽建模强化模型安全,实验验证其有效性。

量子位
算法论文8

ICML 2025 | 西湖大学吴泰霖研究员团队:组合生成式多物理场多元件PDE仿真

西湖大学吴泰霖课题组联合多方提出“组合生成式多物理场多元件PDE仿真(M2PDE)”,将仿真问题视为生成式概率建模任务。该成果在多任务测试中表现卓越,被ICML 2025接收。

力学与人工智能
产品应用8

谷歌Nano Banana Pro上线,深度结合Gemini 3,这下生成世界了

谷歌最新图像生成模型Nano Banana Pro(Gemini 3 Pro Image)上线,结合Gemini 3 Pro强大推理与知识,在控制力、文字渲染和世界知识方面升级,能生成高分辨率、一致性强图像,还支持创意操控、多语言文本生成等,多产品将上线。

机器之心