「训练推理效率」共找到 4364 篇相关文章
拒绝计算“一视同仁”!Elastic Attention:让大模型学会“看人下菜碟”
现代大语言模型用全注意力机制计算复杂度高,现有混合注意力策略是静态的。为此提出Elastic Attention,引入轻量级Attention Router,具备动态路由等亮点,在主流模型测试中效果好。
卢宗青团队新作:人类先验打底,统一动作对齐,通用机器人模型正在落地
机器人行业核心问题是让机器在真实世界稳定行动。卢宗青团队论文《Being - H0.5: Scaling Human - Centric Robot Learning for Cross - Embodiment Generalization》给出通用操控路线,系统性解决多形态平台部署问题。
程序员每十年就“要被取代”一次:这件事从 1969 年开始
文章回顾软件开发史,从 COBOL 到如今的 AI 编程工具,每次新技术都承诺让编程变简单,但始终无法绕开复杂性。指出软件开发瓶颈在处理复杂性的思考能力,提醒用新工具时保持清醒。
Anthropic:大模型开始意识到自己在想什么!
Anthropic的Jack Lindsey论文《Emergent Introspective Awareness in Large Language Models》对大模型做神经科学受控实验。发现Claude Opus 4/4.1能感知内部念头,区分内外状态,通过检查内部状态一致性判断输出意图。
我的 2025 总结:当 AI 开始释放创造力,工程师如何重新站位
2025 年 AI 开始释放创造力,重新定义知识工作。作者在编程上向创造性工作倾斜,设计适配 AI 的架构、落地 DSL;写作上 AI 提升生产力但削弱创作欲。2026 年需探索新竞争力,实现角色转变。
裁4000人换来的AI全白搞?Salesforce悄悄改架构:用 “老技术”故障少还省钱,网友怒喊:CEO零遣散费滚蛋
Salesforce曾大举部署AI并裁员,宣称Agentforce能降本。但如今高管称不过度依赖大模型时运行更好,已引入基础自动化技术。其应用遇瓶颈,故障频发、成本高,还面临AI“漂移”等问题。
大模型幻觉的源头找到了!清华团队锁定大模型宁愿说谎也要讨好人类的神经元
清华大学研究团队深度解剖大语言模型微观机制,确认幻觉关联神经元存在,揭示其与过度服从行为相关。通过干预神经元激活状态可增减模型幻觉行为,为开发可靠 AI 系统提供靶点。
AI体育教练来了!中国团队打造SportsGPT,完成从数值评估到专业指导的智能转身
现有智能体育系统多停于‘打分+可视化’,通用大模型处理体育生物力学分析有局限。中国团队提出SportsGPT框架,实现从‘动作评估’到‘训练处方’智能闭环,各模块优势明显,超越基线。
大模型的进化方向:Words to Worlds | 对话商汤林达华
量子位对话商汤林达华,探讨大模型发展。商汤的SenseNova - SI超越李飞飞团队模型,林达华认为单纯依赖参数规模的AI范式遇瓶颈,商汤推出NEO架构革新,还在落地应用优化,为年轻人指明新赛道。
谢赛宁REPA得到大幅改进,只需不到4行代码
Adobe Research等团队对REPA展开研究,发现驱动目标表征生成性能的是空间结构而非全局性能。基于此构建iREPA,代码不到4行,能提升REPA收敛速度,在多方面表现出色。