「新模型」共找到 9449 篇相关文章
北大校友、华人学者金驰新身份——普林斯顿大学终身副教授
华人学者金驰宣布在普林斯顿晋升为终身副教授,任命2026年1月16日生效。他在机器学习理论领域贡献大,为LLM崛起提供数学基石,解决非凸优化和强化学习样本效率等问题。
押注Agent,林俊旸带着新公司杀回来了
前阿里Qwen负责人林俊旸创办Pragmatik Labs/语用科技,研究跨数字与物理世界的下一代agent。红杉中国、高榕创投领投,腾讯等跟投。其目标是用agent实现终极生产力,有独特技术底色与愿景。
Reasoning新突破:SoftCoT++如何让LLM‘多想几条路’?
LLM推理依赖‘思维链’,传统方法在离散token空间生成步骤有信息丢失、多样性不足问题。SoftCoT++在连续空间生成‘软思维’,拆分‘思考’与‘推理’,用专用初始token和对比学习,实验中全面超越传统方法。
SimpleTIR:让大模型“边写代码边思考”不再崩溃
SimpleTIR可解决多轮工具调用中训练崩溃问题。作者指出崩溃原因是分布偏移、低概率token链式雪崩和梯度爆炸。它采用void turn过滤,掐断崩溃链路,训练稳定,还催生多样推理行为,且工程友好已开源。
意图是 AI 时代的新入口|AGIX PM Notes
文章围绕AI时代展开,指出互联网时代商业模式核心是“入口”,AI时代应关注“意图”。还提及上周对冲基金资金流动、AI企业动态,如微软推安全方案、Alphabet合资开发机器人等。
机器人终于能用明白洗碗机了|UC伯克利新研究
UC Berkeley团队发表研究论文,通过‘模块化教学+智能选动作’方案破解人形机器人全身协同难题。该方案结合星动纪元STAR1硬件优势,经实验验证效果远超传统方案,为机器人产业化带来落地价值。
显存暴降92%!哈工大为线性注意力开辟了新道路
哈尔滨工业大学等团队发现线性注意力性能不足根源是查询范数丢失等。基于此提出NaLaFormer,在ImageNet - 1K准确率最高提7.5%,超分任务峰值内存降92.3%,为线性注意力发展开辟新道路。
FriendliAI获2000万美元,以加速AI模型推理工作负载
专注AI推理的初创平台FriendliAI获2000万美元种子扩展轮融资,资金用于加速平台开发。其专有推理优化技术可降低模型运行成本和能耗,能为用户省90%的GPU成本,合作客户广泛。
豆包官宣手机助手:AI 还能带来哪些新体验?
字节豆包团队官宣做手机助手,它基于操作系统层面授权,背靠豆包大模型带来交互创新。虽无自研手机计划,但正与多家厂商洽谈合作。开放体验机型是与中兴合作的nubia M153。
突发!arXiv CS新规:未经同行评审,一律不收
arXiv CS板块新规,「综述/调研」和「立场」类论文须经同行评审才可收录。因LLM生成论文激增,此类无实质价值论文增多。但学界大佬对此不满,认为会误杀优质内容,拖慢成果发布。