两阶段训练法」共找到 3112 篇相关文章

算法论文8

对话 Synergy 团队:「龙虾」之后,下一代智能体正演变为「互联网公民」

年间,AI Agent能力与数量爆炸。Synergy团队认为,下一代智能体应是“智能体公民”,需跨过建立身份、学会协作、实现进化三道门,还探讨了其对互联网的影响及人机共处问题。

AI科技评论
开源动态7

OpenAI解密大模型失控:它不是变坏,而是「太听话」

OpenAI公开IH - Challenge,解决大模型指令冲突难题。指出大模型问题多因听信错误指令,给出系统>开发者>用户>工具的指令层级结构,设计数据集训练模型遵循高信任等级指令,提升安全可控性与抵御提示词注入能力。

新智元
算法论文8

12个Ai编程Agent同台PK,最贵的不一定是最强的

上海交大和美团联合发布PRDBench论文,将12个主流AI编程Agent放入50个真实Python项目测试。结果显示,基础模型写代码强,商业版调试优势明显;专门训练的裁判模型比通用大模型靠谱。

CourseAI
新闻资讯7

DeepSeek V4真要来了?万亿参数模型匿名开测,免费跑龙虾

推特博主曾‘预示’DeepSeek V4要来,后澄清不确定。今OpenRouter上新‘Hunter Alpha’和‘Healer Alpha’神秘模型,免费且可跑‘龙虾’,社区对其归属猜测不断,答案待官方揭晓。

机器之心
算法论文8

从视觉出发统一多模态!颜水成团队最新研究:不再把图像编解码器塞进LLM|ICLR'2026

NVIDIA研究员Jim Fan称AI正经历第二次预训练范式转移。颜水成团队Muddit模型从视觉先验出发,用离散扩散框架统一文生图、图生文和VQA,挑战多模态“语言中心论”,在多任务表现出色。

量子位
算法论文8

微软 & UT Dallas 联手揭秘:从 SFT 到 RL 的进阶之路

微软与 UT Dallas 合作论文揭秘大模型做漏洞检测从 SFT 到 RL 的后训练流程,构建 C/C++ 漏洞数据集跑通全流程,总结六大‘避坑’指南,还开源整套框架、数据集和模型。

深度学习自然语言处理
新闻资讯8

对话蚂蚁灵波首席科学家沈宇军:2万小时真机数据,用“慢功夫”做具身智能|甲子光年

蚂蚁灵波首席科学家沈宇军接受专访,称具身智能处于‘GPT - 1时刻’。团队选‘慢’路,积累2万小时真机数据,发布四个具身智能模型并开源。介绍模型架构、优势、问题及未来计划,还谈了开源考量等内容。

甲子光年
算法论文8

百度沧海·存储 Mantle 系统架构演进之路,SOSP'25 论文背后的故事

文章讲述百度沧海·存储Mantle系统架构演进故事。面对云存储挑战及业界方案局限,团队经多阶段探索,构建Mantle及MantleX架构,解决性能难题,并规划后续升级方向,为业界提供新思路。

InfoQ
推荐文章8

玩不过来AI新品?实测10大神级Skills,各种AI工具通杀!

2026年AI工具更新快,核心概念是Skills。它比追新工具重要,可跨平台复用。作者实测10大神级Skills,涵盖内容处理、设计开发等阶段,还推荐了Skill管理产品Agent Skills Guard。

鲸选AI
推荐文章8

解决算力瓶颈,给多模态瘦身!Token压缩完整图谱与选型指南

给多模态大模型瘦身是解决算力瓶颈的关键。Token压缩技术可剔除视觉冗余,提升训练与推理效率。北大等团队剖析其全貌,给出完整图谱与选型指南,还揭示了未来演进路径。

AIGC开放社区