「嵌套可扩展监督」共找到 599 篇相关文章
ICML 2025 Spotlight | 多模态大模型暴露短板?EMMA基准深度揭秘多模态推理能力
最新研究推出 EMMA 基准测试,揭示顶尖多模态大语言模型在深度视觉与文本融合的复杂多模态推理上显著不足。该研究已被 ICML 2025 接收,代码数据开源。实验表明,现有模型与人类专家差距大,视觉推理是核心瓶颈。
今年最难的机器人Demo,“机器人含量”为0
自变量发布全新灵巧操作系统TwinDex,后训练阶段真机遥操数据为0,机器人就能完成多项精细操作。该系统设计有灵巧性、一致性和可扩展性,降低了对真机遥操数据的依赖,使高质量数据与真机遥操的强绑定松动。
还是你们会玩,2.9k Star OpenBiliClaw
OpenBiliClaw把浏览器扩展等拼成内容发现Agent,将内容推荐主导权交回用户。它汇总显式授权来源信号找内容,形成本地画像。介绍其架构层级、核心闭环,也提醒“本地优先”仍需做隐私检查。
AI终于“长”进机器人身体里!机械臂学会用触觉思考
香港科技大学申亚京教授团队研发出具身机器人手臂 EmArm,实现亚毫米级触觉定位与实时‘感知 - 行动’闭环。研究还提出‘感知 - 驱动’一体化算法,为打造物理 AI 机器人提供可扩展技术路径。
Harness 工程之道:Skill 原理与最佳实践
文章介绍 Agent Skills,一种为 AI Agent 扩展能力的规范。从概念原理出发,结合 trade-ab-skill 项目,讲解结构规范、触发机制、作用域优先级及最佳实践,还介绍用 skill-creator 创建 Skill 的流程。
大厂代码库几百万行,Claude Code怎么跑起来的?Anthropic首次公开全套打法
Anthropic发布文章总结Claude Code在企业规模部署的最佳实践。Claude Code导航类似软件工程师,与RAG驱动工具不同。其harness由多扩展点组成,在部署中有三种常见配置模式,还给出应用建议。
2篇最新Anthropic论文,揭开LLM对齐新范式
Anthropic在5月连发两篇研究,揭示LLM对齐训练新范式。指出单纯模仿正确行为不足以保证安全,需在预训练与对齐微调间插入教原理阶段。研究围绕Claude模型展开,有多项关键发现,MSM方法效果显著。
科研人有自己的“吃虾”方式!斯坦福普林斯顿最新开源,仅需一行指令
斯坦福和普林斯顿高校团队开源“科研版龙虾”LabClaw,只需一行命令就能调动。它是AI的“技能包”,还能部署成AI实验室助手。此外还配操作系统LabOS,人机协作效率高,扩展性好。
Gemini 3「开眼」像素级操控!谷歌回应DeepSeek-OCR2
Google DeepMind为Gemini 3 Flash推出Agentic Vision,让模型主动编代码操控图像,性能提升5% - 10%。该能力已上线,谷歌还计划扩展功能。这或许是受DeepSeek-OCR2刺激,两者技术路线不同。
GAG:超越RAG,无需检索的私有知识注入新范式
在高价值私有场景,主流大模型注入知识的路线各有硬伤。中科院和360AI联合团队提出GAG方案,无需检索、固定底座、单Token、即插即用,实验显示效果佳,也指出跨域组合等局限。