「LLM训练」共找到 2875 篇相关文章
赛博鸡生蛋,7小时用Claude Vibe Coding一个Mini-Claude
本文是小白向文章,用Vibe Coding方式参考Claude实现精简版Mini-Claude。介绍开发流程,含打通LLM API调用、完成tool use调用等步骤,还提及后续待做事项及对AI开发的思考。
脸谱心智陆弘远团队ACL 2026新作:别再给模型叠加「高级词」了!模型更爱听「大白话」
脸谱心智与香港中文大学科研人员中稿 ACL 2026 的新工作提出 Adam’s Law,即文本频率定律,揭示文本频率对模型训练及推理的重要性,还给出工程解法,实验效果显著,为行业带来新思路。
首个大规模记忆湖发布,AI Infra跑步进入“记忆”时代
LLM是AI的“第一大脑”,记忆平台是“第二大脑”。当前AI企业应用进入生产力时代,竞争聚焦“隐性知识”记忆化。质变科技发布MemoryLake,具备多方面能力,在性能上优势显著,已服务众多用户和企业。
阶跃新模型快到“没推理”!印奇上任,果然气势一新
印奇上任后,阶跃星辰发布新一代开源Agent基座模型Step 3.5 Flash,总参数196B,支持256K上下文窗口。它推理快,适配多家芯片厂商,在多场景表现出色,还具备端云协同能力,架构也有多项优化。
机器人看不清,蚂蚁给治好了
天下苦机器人看不清透明和反光物体久矣,问题出在深度相机。蚂蚁集团具身智能公司蚂蚁灵波开源深度视觉模型LingBot - Depth,无需换硬件,用创新算法和大量数据提升性能,还将开源数据集。
Bengio 15 年前论文再夺 AAAI 奖!AI 正告别单纯炫技,走向真实世界
全球人工智能顶会AAAI揭晓年度奖项,Yoshua Bengio 2011年论文获经典论文奖。今年5篇杰出论文研究方向指向AI从炫技走向应用,如ReconVLA改进VLA视觉感知,CADYT解决连续时间因果结构学习空白等。
摩尔线程AIBOOK一周实测:开箱即训的「AI Native」体验
摩尔线程AI算力本MTT AIBOOK专为AI学习与开发者打造。它搭载「长江」芯片,提供50TOPS异构AI算力,运行MT AIOS系统,预置完整AI开发环境。实测显示其部署简单,性能出色,还具备端云一体等优势。
The Batch: 899 | 更划算的推理
研究人员提出 Delethink 强化学习方法,训练大模型定期截断推理 token 至固定最大数量,以限制处理长思维链成本。经测试该模型在多方面超基线,且缓解计算成本限制,为长上下文推理提供路径。
不到百万级,看不见 MCP 的真实问题:创始人亲述这疯狂的一年
MCP 联合创作者 David 复盘其发展,从开源协议到行业事实标准,经历多阶段演进。他指出做对死磕标准 HTTP,踩坑让关键能力成可选致双向能力被削,规模达百万级有扩展性问题,还谈及多方面发展与规划。
Transformer已死?DeepMind正在押注另一条AGI路线
谷歌团队借鉴人类联想记忆,提出嵌套学习,解决AI「灾难性遗忘」问题。强调优化器与架构协同进化,构建联想记忆系统。HOPE架构在多任务表现出色,或开启AI从被动训练到主动进化大门。