「FP4训练」共找到 3405 篇相关文章
OpenClaw 之后,Agentic RL有了新训练范式
大模型技术推动AI从‘回答问题’迈向‘执行任务’,Agentic AI兴起。中国科大认知智能全国重点实验室提出Claw - R1项目,将前沿Agent Runtime与强化学习训练框架结合,为Agentic AI提供新训练基础设施。
HBM Roadmap和HBM4的关键特性
文章介绍 KAIST TERALAB 公布的 HBM 技术,涵盖 HBM 路线图和 HBM4 特性。HBM 路线图展示从容量升级到计算存储融合的进化,HBM4 在电气规格、封装冷却、架构等方面有突破,AI 工具也用于研发。
AI书籍训练诉案,Anthropic与作者达成和解
Techcrunch消息,大模型平台Anthropic就Bartz诉Anthropic案与多名作者达成和解并提交文件。此前下级法院裁定其用书籍训练模型属合理使用,但涉盗版或面临高额处罚,Anthropic曾上诉,和解细节未公开。
传言称:Llama 4 团队80%成员集体辞职!
有爆料称Meta的Llama 4团队约80%成员集体辞职,引发AI圈关注。但Meta员工澄清该消息不准确,且无权威媒体证实。不过Meta和Llama 4项目确实面临高层动荡、模型延期等问题,还分析了可能的深层原因。
自构建智能体:一项 LangChain4j 实验
作者将LangChain4j文档交代码助手,让其参照构建智能体,设计多智能体系统编写、测试和调试代码。实验展示了LangChain4j优势,还对比监督者和工作流两种智能体实现模式,揭示速度与自主性权衡关系。
Thinking Machines再发文:模块化流形让训练更稳定
Mira Murati团队分享神经网络训练推理新研究,提出“模块化流形”让训练更稳定。将权重约束在Stiefel流形,设计Manifold Muon优化器,实验显示效果好,但计算开销和理论问题待解决,代码已开源。
就是阻击OpenAI,Claude抢先数十分钟发布Claude Opus 4.1
就在Sam Altman官宣两个开源推理模型前半小时,Anthropic抢先发布新模型Claude Opus 4.1。该模型能力提升,适用多平台,定价公布,企业用户反馈良好,还提供混合推理模式,不过订阅费遭吐槽。
The Batch: 849 | 用于训练网页智能体的生成数据
开发网页智能体常需大量人力标注训练样本,卡内基梅隆大学与亚马逊团队实现训练数据生成自动化。他们构建数据集,通过智能体工作流程生成数据,微调后 Qwen3 - 1.7B 表现出色,还公开数据与方法。
Qwen3-Next:迈向更极致的训练推理性价比
文章发布Qwen3-Next架构及Qwen3-Next-80B-A3B系列模型,通过混合注意力等改进提升训练推理效率。介绍模型结构、性能优势,还说明使用方法,包括在多平台部署及处理超长上下文,展望持续优化架构。
华为发布如何利用RL训练强大的Deep Research Agent综述!
华为技术团队发布综述论文,首次系统性梳理利用强化学习(RL)训练强大的深度研究代理。论文指出传统SFT和DPO方法有局限,RL优势明显,还在数据构建、算法设计等方面给出进展与路线图。