视觉基准测试」共找到 2534 篇相关文章

算法论文8

3D-R1:让AI理解3D世界的下一步

文章介绍新研究3D - R1,它是更通用、具推理能力的三维视觉语言模型,解决了当前3D VLM空间理解不足与推理能力薄弱问题,在多任务测试领先,有广阔应用前景。

机器之心
算法论文8

RAG搜对了却答错?德国萨尔大学找到了真相丨ACL'26

RAG是大模型落地标配技术,但存在搜到文档却答错的痛点。德国萨尔大学等团队提出Disco - RAG框架,在‘搜’和‘答’间加入‘读懂’环节,已被ACL 2026主会录用,在多基准测试表现优异。

量子位
开源动态8

告别大模型“失忆”!人大开源MemSifter:轻量代理先思考再回忆,搞定长时记忆

中国人民大学团队提出全新LLM记忆管理框架MemSifter,打破长时记忆管理‘精度不够’和‘成本太高’的困局。它将记忆检索‘外包’给轻量级代理模型,采用任务结果导向的RL训练范式,在8个基准测试中超越现有SOTA方案。

深度学习自然语言处理
开源动态8

超越DeepSeek-R1,数学形式化准确率飙升至84% | 字节&南大开源

字节跳动Seed团队与南京大学联合发布CriticLean框架,将数学自然语言到Lean 4代码的形式化准确率从38%提升至84%。该框架创新性地将评估模型置于核心,解决语义对齐等问题,还构建了相关基准测试和数据集。

量子位
算法论文8

谢赛宁盛赞字节Seed新研究!单Transformer搞定任意视图3D重建

字节Seed康炳易团队的最新研究成果Depth Anything 3(DA3),获谢赛宁盛赞。它架构简单,能从多种输入中精准算出物体深度、还原相机位置,在新视觉几何基准上表现出色,核心秘诀是极简设计。

量子位
开源动态8

荣登HuggingFace周榜首位, 人大高瓴与快手提出ARPO实现智能体高效训练!

人大高瓴与快手提出的ARPO项目受高度关注,荣登Huggingface Paper日榜、周榜双首位。它是为多轮交互型LLM智能体设计的强化学习算法,在基准测试中,用一半工具调用预算就显著优于现有方法。

PaperAgent
产品应用8

智谱AI发布桌面Agent,轻松训练 AI数字员工

智谱AI发布ComputerRL自主桌面智能框架,旨在让AI像人一样用电脑。它融合API与GUI,采用分布式训练,引入Entropulse解决探索衰减。在OSWorld测试中表现亮眼,虽有视觉感知等挑战,但意义重大。

AIGC开放社区
算法论文8

视听分离SOTA提速6倍!清华发布首个6M高性能模型|ICLR'26

清华大学团队推出Dolphin模型,仅用6M参数,通过离散化视觉编码和热扩散注意力机制,实现单次推理精准分离语音,速度提升6倍以上,在多项基准测试中刷新纪录,为端侧设备部署开辟新路。

新智元
新闻资讯8

LeCun亲自出镜打脸质疑者!憋了20年的AI世界模型,终于爆发了

LeCun亲自出镜介绍V-JEPA 2新进展,目标是开发改变AI与物理世界交互的世界模型。V-JEPA 2基于视频训练,有两阶段训练细节,能用于机器人规划,Meta还发布三个基准测试,后续将研究分层和多模态JEPA模型。

新智元
新闻资讯8

Cursor终结者?Grok 4正式登顶!马斯克扬言编程碾压,20万N卡年赚47亿美金!

时隔5个月,xAI发布通用模型Grok 4,后续还将推三款模型。Grok 4上线,有三个订阅版本。马斯克称其智能超博士生,多项基准测试领先,编码或超Cursor。其性能强大源于训练投入和计算扩展。

AI前线