「输出效率」共找到 1486 篇相关文章
离谱……面壁让 AI 写了个训练框架,然后它自己训出了最强的 1B 模型:MiniCPM5-1B
面壁发布 1B 参数量级最强端侧文本大模型 MiniCPM5 - 1B,其 Base Model 由 AI 编写的训练框架 ForgeTrain 训出,速度超英伟达 Megatron 10%。该模型性能出色,部署门槛低,数据治理方案对应数据集也已开源。
乐鑫开源首个「物联网设备Agent框架」,Claw的风终于吹到硬件上
乐鑫开源首个物联网设备Agent框架ESP - Claw,用C语言重写。它核心理念是对话即创作,可让用户通过聊天定义硬件行为。具备运行效率高、内存占用低等特点,还有多种功能及良好的生态适配性。
ACL 2026|答得更准还写得更短?华为泰勒实验室提出SHAPE,给LLM推理装了个「推理税」
华为泰勒实验室等团队提出 SHAPE,给推理链装「里程碑 + 推理税」机制。它分三步,能统一势能增益度量、阶段难度感知和 token 效率约束。实验显示,它提升准确率、降低 token 消耗,还解决了推理坍缩等问题。
Claude Opus 4.6差评如潮!思考深度暴跌67%,AMD总监6852次日志打脸
Claude Opus 4.6遭差评,用户感其「变笨」,输出浅、易失败、违规提示增多。AMD总监用6852次日志证明其「思考深度」降67%,价格高却性能倒退。Anthropic虽称优化,但用户不满默认值被改。
让离线强化学习从「局部描摹」变「全局布局」丨ICLR'26
现有生成式离线强化学习方法在复杂连续任务长程规划中易陷入局部合理但全局偏航的窘境。厦门大学和香港科技大学提出MAGE算法,采用自顶向下策略,实验显示其多任务表现出色、推理效率高。
离职特斯拉“隐身”14个月,杨硕创业终于亮牌:重新定义机器人训练范式
杨硕从特斯拉擎天柱团队离职创业一年多后,妙动科技团队带来新论文《DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control》。该团队用视频训练机器人动作,提出DiT4DiT模型,解决VLA模型不懂物理问题,在人形机器人上有新突破。
Claude Code、Cursor 可能都躲不过一次“大重写”,但 OpenCode 也许是例外
文章指出Claude Code、Cursor等AI编程工具因开发方式问题,代码库陷入难逆转状态,或迎“大规模重写潮”。而OpenCode强调代码一致性,代码库更干净。其创始人分享开发经验、工作流及对行业现象的看法。
刚刚,小云雀的短剧Agent上线了,背后是字节自己的Seedance 2.0。
字节的小云雀短剧Agent上线,以Seedance 2.0为底层模型。它能根据剧本或设定自动生成高质量短剧,提升了AI短剧创作效率,且不挑风格。文中还介绍了使用流程及剧本创作方法。
卡帕西630行代码炸出81个智能体,4天协作跑2333次实验,公布预训练十大发现
Karpathy的Autoresearch项目630行代码让AI自主实验,提升语言模型训练效率。全球开发者让多智能体协作,智能体自发形成同行评审制度。项目发起者公布十大发现,还衍生出表现出色的auto - discovery项目。
The Batch: 919 | 本地 AI 能否替代云端?
大语言模型预测输出需求推动数据中心扩建,研究人员探讨本地小型模型能否分担算力负荷。斯坦福与Together AI团队研究发现,本地系统单瓦特智能量与云端有差距但在缩小,若准确率相近可节省能耗。