视觉 - 语言推理」共找到 3226 篇相关文章

新闻资讯7

GPT-5真的拉胯吗?机器之心一手实测,网友:还我4o、还我4.5

OpenAI发布GPT - 5后评价褒贬不一。有人认为它进步大,也有人差评,如制作游戏、重构代码失败。机器之心实测发现其表现不稳定,写作、推理、编码能力有好有坏,复杂任务表现欠佳。

机器之心
新闻资讯7

烧钱一年,李飞飞的「空间智能」愿景有变化吗?

在a16z主持的访谈中,李飞飞和Martin Casado探讨「世界模型」等话题,重新介绍World Labs愿景。李飞飞指出语言模型描述3D世界有局限,空间智能是关键,公司已推出相关技术和开源渲染器。

机器之心
产品应用7

Meta发布Muse Spark,MSL的首份答卷!Alexandr Wang通过了吗?

Meta发布Muse Spark,是MSL首个模型,经九个月技术栈重构,效率优先。它有原生多模态推理能力,Contemplating模式处理复杂查询,安全评估突出,产品功能升级,商业化转向明显,正逐步在Meta应用推出。

AI工程化
算法论文8

AAAI 2026杰出论文奖 | ReconVLA:具身智能研究首次获得AI顶级会议最佳论文奖

具身智能常被视为‘系统工程驱动’研究方向,ReconVLA获AAAI杰出论文奖,是具身智能方向首次获AI顶级会议最佳论文。它解决VLA模型关键瓶颈,通过重建式隐式视觉定位机制,实验效果显著。

机器之心
新闻资讯8

Mistral 发布 OCR 3,提升了手写及结构化文档识别的准确率

Mistral 发布 OCR 3,在多种文档类型上精度更高,超越前一代产品。能提取文本、识别图像并保留文档结构,输出 Markdown 格式。早期用户认可其性能和多语言支持,生产部署扩展快,价格有优势。

InfoQ
算法论文8

Meta打开AI元认知,让AI不止会解题,还会总结套路了

Meta等机构提出‘元认知重用’机制,让大模型学会反思总结。大模型打造‘行为手册’,与主流RAG系统有本质区别。研究人员设计三种实战用法,虽有局限,但为大模型推理难题提供了解决方案。

AIGC开放社区
算法论文8

唯快不破:上海AI Lab 82页综述带你感受LLM高效架构的魅力

语言模型性能提升但成本高,制约落地应用。上海AI Lab联合多家机构总结440余篇论文,形成82页综述,将LLM高效架构分为7类,探讨最新进展,还涉及线性化技术、硬件实现等内容。

机器之心
算法论文8

MeanFlow再下一城,北大提出机器人学习新范式MP1,实现速度与成功率双SOTA

北大研究团队提出机器人学习新范式MP1,将MeanFlow引入机器人学习,实现毫秒级推理速度。还引入分散损失提升少样本泛化能力,在仿真和真机测试中,实现速度与成功率双SOTA。

机器之心
算法论文7

Anthropic最新研究:Claude存在神秘J空间,与人类心智高度相似

Anthropic研究团队在Claude中发现类似人类大脑工作机制的J空间,它存在于模型神经激活中,能让模型默默思考。失去J空间Claude在多步骤推理任务表现变差,还可暴露模型意图,团队已创建演示工具JLens。

AI寒武纪
算法论文8

超越MLA!新架构MLRA百万token,解码最高2.8倍速 | ICLR'26

语言模型处理长文本时,自回归生成受限于显存带宽。为减少KV缓存开销,业界尝试多种方法,但MLA有缺陷。宾夕法尼亚州立大学等研究人员提出MLRA,拆分KV缓存为四个并行分支,降低显存占用,实现4路张量并行,性能更优。

新智元