「总结者训练」共找到 2716 篇相关文章
清华团队预言:90%的人将脱离谋生劳动,「零人公司」时代来了!
清华沈阳团队基于研究与实践提出四大颠覆判断,如AI走向「人机隔离」、未来公司只剩一人或零人等。团队在模型训练、微调等多方面有成果,还探讨行业应用、知识范式颠覆等,描绘AI发展图景。
DeepSeek不惜代价保住它!V4关键特性被挖出来了
DeepSeek V4技术报告被深挖,为保留核心设计「batch invariance」不惜代价。该设计能保证线上推理稳定、各环节对齐,是复杂上下文系统底座,但会牺牲GPU利用率等,换来训练等多阶段可复现和稳定度。
The Batch: 944 | Llama 之后的时代
Meta发布首个AI模型Muse Spark,是多模态推理模型,在部分健康和多模态测试领先,编程与智能体任务有不足。Meta披露技术细节少,该模型基准测试有竞争力,但其从开放转向封闭引开发者担忧。
港大×复旦×上交:视触觉融合+闭环纠错,让机器人双臂协作不再「盲操」
港大联合复旦、上交大提出TAMEn,在UMI框架上全方位升级,构建视触感知融合等数据闭环,打通数据采集到再训练链路。其三层闭环让机器人学得更快准高效,在双臂协作任务中提升成功率。
Anthropic 的 Harness 设计:build to delete
Anthropic工程博客发布Harness设计文章,探讨Claude完成全栈应用开发任务。指出单Agent模式问题,采用GAN式对抗、三Agent编排,对比单Agent与多智能体产出,还介绍调教评估者及编排简化,提出Build to Delete原则。
MiroMind新模型超越GPT-5.4,三位顶尖AI科学家加盟
MiroMind发布MiroThinker - v1.7模型家族,在深度研究任务中表现出色,其专有智能体MiroThinker - H1超越多个顶级闭源模型。同时,三位顶尖科学家加盟,分别负责推理模型训练等方向,公司聚焦推理与可验证性。
1美元时薪?这才是打工人的「梦中情模」
Anthropic 的 Opus 4.6 好用但贵,MiniMax 推出 M2.5 与之抗衡。M2.5 在多方面表现卓越,参数量小,成本低,推理速度快,还经实测能成打工人得力助手,其背后有独特训练体系。
前 Codex 大神倒戈实锤!吹爆 Claude Code:编程提速 5 倍,点破 OpenAl 死穴在上下文
前OpenAI工程师、Codex项目早期研发者Calvin French - Owen在播客中锐评代码智能体,他偏爱Claude Code,称其编程提速5倍,优势在上下文拆分能力。他还点出OpenAI与Anthropic产品理念差异,分享上下文管理经验。
挺意外的,Agent长期记忆潜力被AMemGym挖出来了
论文提出交互式在线策略评测框架AMemGym,它能反映AI助手长期记忆能力、驱动Agent自我进化记忆。它以结构化状态演化为骨架支撑自由对话评测,还对主流记忆系统做了扫描,带来评估与训练范式转换。
美团提出全新多模态统一大模型STAR,GenEval突破0.91,破解“理解-生成”零和困局
近日美团推出多模态统一大模型 STAR,以“堆叠自回归架构 + 任务递进训练”实现理解与生成双重突破。它解决行业痛点,通过三大核心设计统一能力,实验在多任务中表现顶尖,还给出后续探索方向。