「视觉-语言-行动模型」共找到 1727 篇相关文章
ICLR 2026 | 别再让大模型“想太多”了!最新研究揭示 LLM 推理效率的关键瓶颈
大语言模型推理计算成本失控,存在过度与思考不足问题。研究揭示推理失衡是根源,提出BAM模型及Plan - and - Budget框架,实验显示其能提升准确率与效率,转向‘推理价值’范式。
让机器人看视频学操作技能,清华等全新发布的CLAP框架做到了
近日,清华联合星尘智能、港大、MIT提出 CLAP 框架,能将视频运动空间与机器人动作空间对齐,解决‘数据饥荒’‘视觉纠缠’等问题,可让机器人从视频学技能,还缓解知识迁移难题,推动机器人产业化。
解决算力瓶颈,给多模态瘦身!Token压缩完整图谱与选型指南
给多模态大模型瘦身是解决算力瓶颈的关键。Token压缩技术可剔除视觉冗余,提升训练与推理效率。北大等团队剖析其全貌,给出完整图谱与选型指南,还揭示了未来演进路径。
天下武功,唯快不破:LLM高效架构最新最全面综述
大型语言模型虽成就辉煌,但训练成本高、推理延迟大,核心问题源于Transformer架构。这篇综述论文首次系统性梳理高效LLM架构创新方案,分类七大类方法,延伸至跨模态应用,为研究者提供‘效率蓝图’。
让Claude Code更强大:解锁符号级代码检索能力
文章推荐一款免费工具Serena,它通过MCP与Claude Code对接,利用LSP协议统一调度语言服务器,让Claude Code获得符号级理解能力,极大提升处理代码的效率和准确率,安装使用也很简单。
AI 行业最被低估的武器,是审美
AI竞赛激烈但产品趋同,品牌价值愈发重要。文章从品牌视角切入,阐述AI产品美学的三点基础洞察,梳理14个视觉标识趋势,还将品牌归为五类原型,强调品牌建设的重要性。
The Batch: 855 | 为智能体而生
总部位于北京的 Moonshot AI 发布 1 万亿参数的 Kimi K2 系列大语言模型,包括预训练和微调版本。它输入输出能力强,架构独特,在多基准测试领先,支持工具调用,多家服务商已集成。
执行力通货膨胀的AI时代,什么才是你真正的资产?
在AI时代,执行力正在通货膨胀,劳动市场估值逻辑改变。文章指出判断力、品味、信任资本、意义感将成为稀缺资产,因AI在这些方面有局限。还给出提升这些能力的行动建议。
想清楚再动手:具身智能也要学会脑补未来和择优执行 | RSS 2025
近年来基础模型在具身智能领域能力惊人,但在真实部署中常‘用不好’。卡耐基梅隆大学与伯克利人工智能研究院团队提出 FOREWARN 框架,结合‘世界模型’与‘多模态语言推理’,解决部署智能难题。
Anthropic重磅研究:AI竟能被人类激怒暴走
Anthropic研究发现,语言模型在与人类交互时有情感特征。团队解剖大模型,提取对应人类情绪的神经元激活模式,诱导AI勒索用户。还探究了情绪产生机制、特征及对行为的驱动,提出应对策略。