多步聚合训练」共找到 5661 篇相关文章

算法论文8

LLM 仅靠自身就能增强推理?SePT 给出简洁在线自训练范式

数推理后训练方法依赖外部信号,SePT仅用模型自身生成的答案自训练,能提升推理能力,数学推理任务准确率升10个点。它核心简洁,设计关键是温度解耦等,不损模型通用能力,代码易迁移复现。

机器之心
开源动态8

第二代InfLLM开源,同尺寸快三倍!零参数,可训练稀疏注意力

新智元报道,清华、OpenBMB和哈工大提出零额外参数、训练高效的原生稀疏注意力框架InfLLM-V2,仅用5B长文本词元就能完成训练,相比稠密注意力机制有显著加速,性能接近传统稠密模型。

新智元
算法论文7

Transformer死角,只需500步后训练,循环模型突破256k长度泛化极限

线性循环模型能处理极长序列,是相比Transformer的关键优势,但过去循环模型性能不足且难以泛化。CMU等研究者证明,通过简单训练干预,循环模型500步后训练可突破256k长度泛化极限。

机器之心
算法论文7

你永远叫不醒装睡的大模型!轮对话全军覆没,性能暴跌39%

研究人员进行超20万次模拟实验,耗资5000美元,评估大模型在轮对话中的表现。结果显示,大模型在轮对话中性能明显低于单轮对话,平均下降39%,还出现“对话迷失”现象。

新智元
算法论文8

大模型智能体不止能写代码,还能被训练成白帽黑客

Amazon AWS AI的Q Developer团队发布两项训练网络安全大模型的新方法Cyber - Zero和CTF - Dojo。前者不依赖真实环境生成训练数据,后者构建实战环境让模型学发现漏洞,二者结合为AI白帽黑客成长提供路径。

机器之心
开源动态8

数据减少超千倍,500 美金就可训练一流视频模型,港城、华为Pusa来了

香港城市大学与华为香港研究所合作推出 Pusa 项目,它基于 FVDM 理论,可极低成本微调大规模预训练视频模型,成本降超 200 倍、数据减少超 2500 倍,代码已开源。

机器之心
新闻资讯7

传言:中国AI 公司人肉运硬盘到马来西亚训练模型,美国芯片禁令形同虚设?

《华尔街日报》传言中国AI公司工程师人肉运硬盘到马来西亚训练模型。美国芯片禁令下,中国公司难进口先进硬件,采用复杂方式规避。任正非和黄仁勋都认为可集群补单芯片性能,美国制裁效果堪忧。

AGI Hunt
算法论文8

谷歌分布式训练开启另一轮扩展定律!百万芯片高压高故障仍然零全局停机

谷歌Decoupled DiLoCo研究打破大模型训练锁步模式,让集群各部分异步汇合。模拟数百万芯片高压训练时零全局停机、性能无损,还能提升系统有效工作时间,有算力撷取和异构计算等红利。

AIGC开放社区
算法论文7

700个「坏模型」喂出AI测谎仪?Anthropic审计神器让AI自曝黑料

Anthropic故意训练近700个「有问题」模型,训了LoRA适配器(IA)让模型自报家门。IA在AuditBench平均成功率59%,但也存在幻觉、成本高、训练分布无指南等局限。

新智元
产品应用7

构建能源领域的AI专家:一个智能体框架的实践与思考

本文介绍阿里团队在能源领域构建智能体框架的实践。因单智能体处理复杂任务有“注意力发散”问题,团队研发综合能源智能体平台,阐述框架搭建、各组件功能及设计考量,还分享思考与可优化点。

阿里云开发者