「训练硬件」共找到 2575 篇相关文章
DeepSeek V4 借实习生获奖论文“起飞”?梁文峰剑指上下文:处理速度提 10 倍、要“完美”准确率
ACL公布2025年获奖论文,中国作者比例超51%。DeepSeek梁文锋通讯、实习生袁境阳一作的论文获Best Paper奖。其提出NSA机制,实验显示性能优、准确率高、速度提升显著,成果或用于DeepSeek V4。
WAIC现场最“聪明”展台!AI眼睛耳朵能力全打开了
WAIC现场,声网展台被观众挤爆,其新奇“AI玩具”都能与玩家流畅对话。声网对话式AI引擎全新升级,新增选择性注意力锁定、视觉理解能力,能与主流数字人方案集成,还可接入大模型,价格低。它已在多领域落地。
刷新无监督异常检测上限!首提「匹配代价滤波for异常检测」范式 | ICML'25
新智元报道,东北大学等团队在ICML 2025提出CostFilter-AD,将「匹配代价体滤波」引入无监督异常检测,构建异常代价体并滤波,无需缺陷样本训练,可作插件提升现有系统,精准检测微小缺陷。
首个多模态工业信号基座模型FISHER,权重已开源,来自清华&上交等
清华、上交等团队联合发布首个多模态工业信号基座模型 FISHER,用搭积木法对异质工业信号统一建模。技术报告和权重已开源,还提出 RMIS 基准评估性能,实验显示其泛化能力强。
GuardAgent:首个专门为LLM agent提供安全Guardrail 的守卫型agent
近年LLM从对话工具变为可自主执行任务的agent,但带来安全隐私挑战。传统安全监护对其力不从心,为此学者发布GuardAgent,它守卫agent,具通用性、精确判断和免训练部署优势,实验表现佳。
借助CoT监管AI?OpenAI、谷歌、Anthropic等罕见联合发文:AI系统安全的新机遇!
OpenAI等支持新研究论文,其指出高级AI不透明性有潜在风险,而‘推理模型’用自然语言推理带来可解释窗口,CoT监控可检测不当行为、发现早期信号等,但也存在使监控性下降的因素。
AI进化时间表已现!LLM每7个月能力翻倍,2030年职场不复存在?
LLM正飞速进化,METR研究发现其智能每7个月翻番。到2030年,一个模型几小时就能完成人类工程师数月的工作。该研究提出“任务完成时间视野”指标衡量模型能力,不同模型表现差异大。
揭示隐藏联系:RLHF/DPO即对比学习!
大型语言模型输出符合人类价值观是挑战,主流技术RLHF复杂、昂贵且不稳定,DPO简化流程但有训练崩溃问题。论文揭示RLHF/DPO即对比学习,提出MIO算法解决DPO崩溃,实验验证其性能优势。
苹果港大终结自回归时代?7B扩散模型发布,AI写代码逻辑彻底颠覆!
苹果联合港大开源扩散大语言模型DiffuCoder,用扩散模型+强化学习策略,性能提升4.4%。研究还提出耦合梯度奖励策略优化方法,建立原生RL训练框架,探究了dLLM的生成机制等问题。
这个推理模型:HRM ,只用2700万参数,超越了DeepSeek和Claude
Sapient Intelligence研究者受大脑机制启发提出分层推理模型HRM,它是全新循环架构,仅2700万参数、1000个训练样本,就在复杂推理任务上表现卓越,还引入近似梯度等方法,有推动通用计算变革潜力。