「空间理解能力」共找到 4059 篇相关文章
关于机器人数据,强化学习大佬Sergey Levine刚刚写了篇好文章
训练大模型难度随规模和应用拓展而增加,所需数据海量。机器人领域获取训练数据成本高,研究者尝试找替代方案。强化学习大牛Sergey Levine分析数据组合,认为鱼和熊掌不可兼得,替代数据有局限。
AI学会左脚踩右脚自进化?Meta华人新研究改写Agent法则
Meta华人学者Jenny Zhang联合多机构研究者提出新智能体框架HyperAgents(DGM - H)。它打破任务能力与自我改进能力需对齐的局限,能跨任务自我改进,还自动生成基础设施,或改写Agent竞争规则。
字节开源GUI Agent登顶GitHub热榜,豆包手机核心技术突破26k Star
字节开源的豆包手机核心支撑GUI Agent模型UI - TARS登顶GitHub热榜,突破26k Star。它是多模态AI智能体,纯视觉驱动,部署简单,历经多轮迭代,成为热门开源多模态Agent。
AI医生终于有了硬标尺!全球首个专病循证评测框架GAPS发布,蚂蚁联合北大王俊院士团队出品
蚂蚁健康与北大王俊院士团队发布全球首个大模型专病循证能力评测框架GAPS及评测集GAPS - NSCLC - preview,解决现有医疗AI评测局限,成果已应用于“蚂蚁阿福”,并客观评价了大模型临床能力。
Claude Code太难?Coze帮你3分钟做出可变现的 Skills
Claude Code和AI Skills很火,但靠其变现困难,如安装调试复杂、不知如何推广等。Coze 2.0更新解决了这些问题,还提供长期计划能力和新年福利,可让用户无需工程能力参与AI生态价值分配。
大模型玩不好数独?!Transformer作者初创公司公布排行榜:o3 Mini High“变异数独”正确率仅2.9%
Transformer作者初创公司Sakana AI公布AI解决数独能力排行榜,用全新基准Sudoku - Bench考验大模型创造性推理能力。结果显示大模型总体正确率仅15%,9×9数独中高性能模型o3 Mini High正确率2.9%。
DeepSeek们越来越聪明,却也越来越不听话了。
论文《When Thinking Fails: The Pitfalls of Reasoning for Instruction - Following in LLMs》用实验验证,模型推理能力变强时,提示词遵循能力变差。研究团队对15个模型测试,发现用CoT推理后执行准确率下降,还提出4种提升指令遵循效果的方案。
Token售卖已无溢价、大模型公司转型“系统商”?记忆张量 CTO 李志宇:智能体能力会拉开差距,长期记忆与状态管理成竞争核心
InfoQ 采访记忆张量 CTO 李志宇,他指出 Scaling up 经济效益下降,大模型公司正变系统公司,核心是长期记忆与状态管理能力。2026 年若模型无代际差,价格战或加剧。智能体是主赛道,但现有模型推理能力不足。
一位工程师对“好代码”的 7 年思考
本文围绕“什么是好代码”展开,作者结合自身职业发展,从初入职场的“黑盒认知”到深入思考多维度评价标准。还介绍代码评审标准,从稳定、体验、效率、成本衡量。最后给出写好代码的方法和面临的挑战。
LeCun有了新证据!大模型思考与人类思考存在本质差别
Yann LeCun参与的研究用信息论揭示大语言模型与人类在‘理解世界’上的本质差异。研究引入新量化框架,分析主流大模型,发现AI与人类在‘理解’上有三大核心差异,对当前AI发展趋势提出挑战。