「训练效率」共找到 3071 篇相关文章
姚顺雨提到的「AI下半场」,产品评估仍被误解
OpenAI研究员姚顺雨提出「AI下半场」重点转向定义问题,评估重要性超训练。亚马逊Eugene Yan发文补充,指出产品评估常被误解,应运用科学方法,践行评估驱动开发,自动化工具也需人工监督。
这款 Rust 文件搜索项目,让 AI 和 neovim 飞起来!
开发时项目大文件多,找文件成本高。Github上的`fff.nvim`项目专注‘极致速度 + 智能体验’,采用Lua + Rust架构,性能好、排序智能。有多项功能特性,还能与AI助手集成,提升效率。
Claude Code 推出语音功能,但是,不支持中文
Claude Code推出语音模式,向约5%用户开放。用户按住空格说话,系统自动生成文本,支持语音与键盘混合输入,能提高录入效率,但大概率不支持中文。此外,电报率先支持OpenClaw流式实时回复。
蒸馏效果起飞!DOPD破解「特权幻觉」,让在线策略蒸馏更有效
近期,新加坡国立大学等团队提出 DOPD 法解「特权幻觉」难题。该法依 token 情况动态蒸馏,实验表明其在 LLM、VLM 蒸馏效果好,鲁棒性强,训练稳定,为在线策略蒸馏提供新思路。
Agent = Model + Harness,一个可能成为2026年出圈的新概念
文章提出新概念Harnesses Engineering,认为Agent = Model + Harness,阐述了Harness的作用、核心组件,还提及模型训练与Harness设计的耦合及Harness工程未来,指出需‘Harness思维’让AI驱动工业革命。
0.9B跑出90%真机成功率!上海交大为VLA补上空间感
上海交大MINT团队提出中间路线Evo - Depth,约0.9B参数,不额外增硬件负担,兼顾仿真与真机性能及部署效率。系统由IDEM、SEM等组成,代码等已开源。
打破视觉Token的算力诅咒,RedundancyLens如何为多模态大模型推理减负
多模态大模型的 Decoder - only 架构处理视觉 Token 有计算冗余。合合信息团队提出无需额外训练的动态计算削减方法,在不影响性能前提下降低推理成本,适用于多场景。
开源一周狂揽 35K 标星!Karpathy 开源 autoresearch:630 行代码让 AI 自动“炼丹”!
前OpenAI、特斯拉前AI总监Andrej Karpathy发布新项目autoresearch,一周揽35.6k Star。它是极简版LLM训练环境,630行代码让AI自动做研究,人类通过Prompt指导,AI自行实验。
拖拽视频编辑进入流式时代!任意时刻、任意内容,实时修改 | ICLR'26
新加坡南洋理工大学和合肥工业大学研究人员在ICLR 2026提出REVEL任务,打造免训练DragStream方法,实现视频生成时实时拖拽编辑,支持多种操作,破解两大难题,实验显示效果、泛化性佳。
北大校友、华人学者金驰新身份——普林斯顿大学终身副教授
华人学者金驰宣布在普林斯顿晋升为终身副教授,任命2026年1月16日生效。他在机器学习理论领域贡献大,为LLM崛起提供数学基石,解决非凸优化和强化学习样本效率等问题。