机器人策略评估」共找到 2386 篇相关文章

算法论文7

DeepSeek-OCR是「长文本理解」未来方向?中科院新基准VTCBench给出答案

DeepSeek - OCR的VTC技术可实现高压缩率,降低长文本处理成本。但视觉语言模型能否理解压缩信息存疑,中科院等推出VTCBench评估,测试模型认知极限,还推出VTCBench - Wild检测鲁棒性。

机器之心
推荐文章8

一文搞懂 Agents 评测丨Anthropic 最新万字长文

传统模型评测方法难评估 Agent 系统,Anthropic 摸索出有效评测设计方法。文章介绍评测结构、意义、方法,涵盖编程、对话等 Agent 评测,还给出打造评测路线图及与其他方法结合的建议。

特工宇宙
算法论文8

We-Math 2.0:全新多模态数学推理数据集 × 首个综合数学知识体系

北京邮电大学、腾讯微信、清华大学团队提出We - Math 2.0,含知识体系、数据集及训练策略,可提升模型数学推理泛化能力。该成果在X上获关注,登Huggingface Paper日榜第一。

机器之心
新闻资讯7

扎克伯格发文正式告别“默认开源”!网友:只剩中国 DeepSeek、通义和 Mistral 还在撑场面

Meta 首席执行官扎克伯格分享“个人超级智能”愿景,透露公司调整 AI 模型发布策略。此前 Meta 强调开源优势,如今态度转变,巨额投入后或暂停开源新模型,计划并行训练开源与闭源模型。

AI前线
开源动态8

ICCV 2025 | UniOcc: 自动驾驶占用预测与推理统一数据集及基准平台

来自多所高校团队在ICCV 2025发表统一基准框架UniOcc,融合多源数据,有体素级运动流标注等创新,提出免真值评估指标,支持协同预测,已开源,能推动自动驾驶迈向新阶段。

机器之心
产品应用7

具身智能的第四阶段:「造系统」?

进入2026年下半年,业内形成共识:具身智能竞争从单一模型比拼转向系统工程与产业基础设施角逐。鹿明机器人推出具身智能开发与验证平台Lumos Station Lite,提出“产业具身”理念,助力具身智能落地。

AI科技评论
算法论文8

物理AI的「原生」时刻:原力灵机发布具身大模型DM0

主流‘预训练 - 后适配’范式有局限,原力灵机联合阶跃星辰提出具身原生 VLA 模型 DM0。它能统一机器人操作与导航,在 RoboChallenge 测试领先,还介绍了架构、训练方法及未来演进方向。

机器之心
开源动态7

有人把巴菲特芒格炼化成Agent,然后开源了…

AI Hedge Fund项目将12位世界级投资大佬“炼化”成Agent,可实时分析股票、完善交易策略,还内置回测模块。它兼容13种大模型,部署门槛低,开源后获高星。不过多数框架未实盘,投资有风险。

量子位
算法论文8

VLA大模型做长任务总断片?同济KC-VLA用关键帧链给治好了

VLA大模型记性是短板,处理非马尔可夫任务常束手无策。同济大学等提出KC - VLA框架,用关键帧链接赋予机器人全局时间感知能力,还构建了长时序记忆依赖基准测试,实验显示其性能优越。

PaperAgent
算法论文8

对抗KV Cache压缩的脆弱性:两行代码以最坏风险控制防御底层假设崩塌

中科大团队在 ICLR 2026 论文中指出 KV Cache 压缩领域底层假设存在缺陷,主流方法基于的稳定性假设在真实场景中脆弱。团队提出防御性聚合策略,仅两行代码修改,显著提升 KV Cache 压缩性能。

机器之心