「训练效率」共找到 3075 篇相关文章
一年4次迭代,狂堆GPU成真!微软AI冷液灌芯,散热暴涨3倍
AI芯片发热问题严重,限制了其发展。微软推出微流体冷却技术,在芯片内开液体血管,散热效率最高提升3倍,温升降65%。一年4次迭代解决诸多难题,影响从省钱到使用体验,更是抢跑未来的布局。
ICML 2026现场最全索引:从快手到大厂,中国企业集体出征
ICML 2026 于7月6 - 11日在韩国首尔召开,投稿量翻倍,录用率26.6%。中国企业全面出击,快手、阿里千问等入选多篇论文,现场活动丰富。中国机构研究呈现从发论文到做现场、单点到系统布局、聚焦效率等趋势。
卡帕西点赞Transformer内置计算机!每秒3万Token吞吐,拿下世界最难数独
当前大模型推理顶尖但精确计算不足,Percepta团队在Transformer权重里内嵌可执行程序,通过2维注意力头设计提升推理效率,能在普通CPU上实现每秒3万+Token的流式输出,还精确求解了世界最难数独。
21 页 PDF 实锤 Grok 3“套壳”Claude?Grok 3 玩自曝,xAI工程师被喷无能!
网友 GpsTracker 爆料,xAI 公司的 Grok 3 在“思考模式”下自称是 Anthropic 公司的 Claude 3.5。多种模式测试显示异常回应仅在“思考模式”触发,21 页 PDF 记录也证实其“自曝”。此事引发热议,有人吐槽预训练团队水平差。
专访火思动力Kevin Ding:未来选择Agent,要看它过去三十天学会了什么|甲子光年
本文是对火思动力创始人Kevin Ding的专访。他指出当下Agent会工作但不会成长,而如今市场需求、技术条件和数据供给成熟,可开展持续学习。他还阐述了后训练、产品应用、商业化等方面观点。
RAG外部检索是多余的,英伟达最新成果颠覆认知
英伟达INTRA论文指出RAG架构中检索器和生成器在不同表示空间工作,存在retriever - generator mismatch问题。INTRA让模型用注意力查询检索自身编码表示,训练量小,在多跳QA上超越多种检索基线。
人大高瓴孙浩团队发表Nature子刊封面文章:基于并行符号枚举的物理定律发现
中国人民大学高瓴人工智能学院孙浩教授团队在《自然 - 计算科学》发表封面论文。提出PSE框架解决符号回归瓶颈,通过公共子树复用和GPU并行提升评估效率,实验表现优于现有方法,也指出了局限性与未来方向。
利用Loop语言模型扩展隐式推理 | 直播预约
当前大语言模型依赖显式文本生成推理,未充分利用预训练数据。将介绍最新工作Ouro,Loop语言模型家族,核心创新多,虽参数少却性能优,还会讨论其推理轨迹及模型Scaling新可能。
“天才少年”5年0收入造JS核武!Claude天价收购Bun,Node.js生态地震,AI工具链战争正式打响!
当地时间12月2日,Anthropic宣布收购热门开发者工具初创公司Bun。Bun能解决智能体分发和运行的效率问题,受AI编程工具青睐。虽收入为0,但因AI编程发展,Bun团队认为加入Anthropic是更好选择。
谷歌Nature震撼发文,Gemini教练暴打专家!医学双料冠军,秒出睡眠报告
谷歌DeepMind把Gemini版大模型PH - LLM调教成「AI健康私教」,将可穿戴设备数据转化为睡眠健身建议,准确率超人类医生。它经两阶段训练,在多项测试中表现优异,或开启预防医学未来。