「后训练阶段」共找到 4164 篇相关文章
从静态模型到数字生命体:自进化AI Agent综述
近年大型语言模型催生AI智能体发展,但现有系统依赖人工预设,难适应动态环境。论文提出自进化AI智能体,可通过环境反馈自动优化,还提出三定律、四阶段范式演进模型等,开源EvoAgentX框架。
Meta最新大模型RL微调:在线DPO/GRPO显著优于离线DPO
Meta和NYU研究强化学习在大模型微调中的有效性,对比离线、半在线和在线训练范式。半在线和在线显著优于离线,多任务结合可验证与不可验证任务能提升性能,还给出不同任务的测试数据。
企业为什么越来越花钱买闭源模型?Decagon CEO 提出了一个很重要的新观点
Decagon CEO Jesse Zhang 提出新观点,未来 AI 会形成产业分工,闭源负责探索,开源负责规模化生产。企业市场开源模型 LLM 支出占比下降,因多数企业处探索阶段,还分析了未来 AI 行业的重要变化。
实测GPT-5:写作坠入谷底,编程一骑绝尘。
GPT-5发布,它是统一系统,含多种模型。性能上减少事实幻觉、应对谄媚有进展,跑分强且节能,但无新功能特性。写作不如GPT 4.5,编程表现出色,发布后OpenAI与Google预测交叉跳水。
美光沉迷制造“电子黄金”,不在乎AI泡沫
当地时间12月17日盘后,美光2026财年第一财季多项业绩指标超预期,营收和利润大涨。美光不相信“AI泡沫”,其业绩增长源于AI驱动的高带宽内存需求爆发。美光预计HBM市场规模将快速增长,还进行了产品结构优化。
HBM之父:HBM的终点是HBF
韩国SK海力士宣布完成HBM4开发,它将成数据中心和AI芯片首选。HBM4有出色数据处理速度和能效,应用后AI服务性能或提升69%。HBM之父金正浩教授预测,未来HBF将取代HBM,还提出金氏定律指导行业发展。
我在WAIC看见的十大趋势
上海世界人工智能大会(WAIC)热度空前,一票难求。本文总结了WAIC呈现的十大核心趋势,如中国AI因DeepSeek而不同,开源大模型进入中国时间,AI创新来到ToC阶段,第一批商业化AI终端是汽车、耳机和眼镜等。
AGI新技术路线:下一代稀疏注意力机制Monte Carlo Attention开源
超对称技术公司开源了 Monte Carlo 注意力机制,用于新版基座模型 BigBang - Proton。它在二进制块编码技术上,用块间代表交流机制实现线性复杂度,解决了传统方法的缺点,可实现理论上无限的上下文长度,对现有预训练技术和硬件设计影响深远。
Claude还是最强,但Anthropic这周好像疯了
Anthropic状告阿里蒸馏模型致其股价创新低。一位87年创业者用AI搭工作流,起初用DeepSeek和Qwen问题多,换Claude后流程顺畅。MRCR v2测试显示国产模型与Claude有差距,便宜与省心模型该怎么选成问题。
相机参数秒变图片!新模型打通理解生成壁垒,支持任意视角图像创作
S-Lab等机构研究员提出Puffin统一多模态模型,它能整合理解相机参数与按参数生成对应视角图片的能力。通过“用相机思考”和400万组数据训练,解决此前模型问题,还构建相关数据集和评测基准,性能出色。