过程评估」共找到 1016 篇相关文章

新闻资讯7

奥特曼小号泄密:OpenAI代码工作100%交给Codex!工程师才揭底Codex“大脑”运行逻辑,碾压Claude架构?

近日,OpenAI工程师揭秘Codex“大脑”运行逻辑,介绍其智能体循环及构建提示词等过程。还提及用1个PostgreSQL主库和50个只读副本顶住8亿用户,同时持续探索数据库性能极限。

AI前线
新闻资讯7

ChatGPT本来要5天后关掉

翁家翌在播客透露,起初推出ChatGPT是为收集用户数据,预期5天后关闭。他是OpenAI多代大模型发布贡献者,还分享了OpenAI内部情况,如模型训练、迭代速度等问题,也谈及自身经历和对AGI看法。

花叔
开源动态8

一个超级搜索Agent开源,超低成本拉满搜索推理能力!小参数、慢思考。

MiroThinker 1.5发布,打响2026年AI模型进步第一枪。它以小参数实现高性能,解决信息雾霾、AI幻觉、决策无力等问题,通过交互式扩展和时序敏感训练沙盒技术,展现强大搜索推理能力。

开源AI项目落地
新闻资讯8

Gemini 3预训练负责人警告:模型战已从算法转向工程化!合成数据成代际跃迁核心,谷歌碾压OpenAI、Meta的秘密武器曝光

2025年底大模型“年终决战”,Gemini 3强势突围。其预训练负责人Sebastian Borgeaud指出,谷歌转向“做系统”,AI进入“数据有限”阶段,合成数据等构成未来进化路径,还分享了预训练热点与挑战。

InfoQ
新闻资讯7

「AI 100」榜单启动招募,AI产品“年会”不能停丨量子位智库

2025年国内AI产品领域涌现众多关键词与颠覆性产品。为把握市场动向,量子位智库2025年度「AI 100」榜单开启招募,分三大板块评选,采用双重评估体系,含多周边内容。

量子位
算法论文8

RL是「点金石」还是「挖掘机」?CMU 用可控实验给出答案

卡耐基梅隆大学研究者构建基于GSM - Infinite的可控合成数据框架,分析预训练、中期训练和RL对模型推理泛化能力的影响,调和了RL有效性的不同观点,为改进训练策略提供基础。

机器之心
开源动态7

这个框架让大模型省下50%内存,合并专家不如直接删掉?

Cerebras Research提出REAP框架,通过专家剪枝和合并技术压缩SMoE模型,能让模型‘瘦身’并保持性能,可省50%内存,但社区测试有不同结果,且存在调度开销等问题。

AI工程化
开源动态8

大模型开发者必读!拆解世界级AI模型的诞生,Hugging Face把4年模型训练经验写成了一本开源指南

Hugging Face发布《The Smol Training Playbook》,分享约4年构建SOTA模型和数据集的经验。手册涵盖是否训练、训练何种模型、如何训练等内容,强调数据质量重要性,还介绍了模型设计、训练中的实践与教训。

AIGC开放社区
算法论文8

推理token减少46%!Meta新方法缩短思维链,告别重复推导

Meta等联合提出元认知复用机制,让模型总结解题思路,提炼为“行为”存于“行为手册”。实验显示,该机制在数学基准测试中显著优化,保持准确率时最多减少46%推理token使用量。

量子位
算法论文8

大模型“精细化”对齐,真实性提升25.8%刷新SOTA!token级精准编辑,无需训练即插即用

北航团队在EMNLP 2025提出Token - Aware Editing (TAE)方法,从token层面解决传统表征编辑技术问题,无需训练、即插即用,在多个对齐维度显著提升,如在TruthfulQA任务上真实性指标提升25.8%。

量子位