「后训练方法」共找到 4802 篇相关文章
最强AI编程工具Claude Code,五个使用Tips
作者认为Claude Code是最强AI编程工具,因Anthropic对其针对性强化训练且不计上下文消耗。国内介绍少因自媒体水平差。作者分享五个使用Tips,如/init初始化、Plan Mode规划等。
图灵奖得主 Yoshua Bengio 智源大会最新演讲:关于AI,我改变了信念,也改变了研究方向
2025年6月6日,图灵奖得主Yoshua Bengio在第七届智源大会发表演讲。他目睹前沿AI行为演化后深感警觉,决定调整科研方向以降低AGI潜在风险,还分享AI“求生”案例,提出构建“科学家AI”新理念。
从答题到做实验:SciAgentGym让大模型进入科学工作流
复旦大学NLP实验室提出SciAgentGym,为科学智能体搭建工作流环境,还设计了评测集SciAgentBench。实验显示模型接入工具能提升成功率,但长流程任务性能下降。论文还提出SciForge构建训练数据,提升了模型表现。
Sora天才辍学生归来!OpenAI组建3人神秘小队,豪赌超级人工智能
当年Sora背后的核心贡献者、00后天才辍学生Will Depue,结束休息重回OpenAI,拉上Troy Luhman和Eric Luhman组成三人小组,目标是超级人工智能ASI。OpenAI也将目标从AGI转向ASI,不过追求ASI风险高、投入大。
Current Robotics 发布 Curr-0:以 Single Policy 实现全身灵巧操作
Current Robotics发布Curr - 0,解决人形机器人移动与操作分离困境。它用Single Policy统一训练,基于HumanEx采集数据,还构建多物理模态交互世界模型,是全栈具身智能基础设施成果。
刚刚,DeepSeek开源OCR 2,首创Qwen编码的「双流架构」
年底 DeepSeek 开源新模型 DeepSeek - OCR 2,首创双流注意力架构,model&paper 一同发布。它重构视觉编码器,采用三阶段训练流程,在 OmniDocBench v1.5 评测及生产环境验证中表现良好。
解决特斯拉「监督稀疏」难题,DriveVLA-W0用世界模型放大自动驾驶Data Scaling Law
自动驾驶领域VLA大模型面临‘监督稀疏’难题,特斯拉公布此挑战。DriveVLA - W0研究提出用世界模型解决,将‘预测未来图像’作自监督训练任务,还提出轻量级架构降低推理延迟。
GPT-5-Codex背后AI Agentic编程技术最新全面综述!
近期OpenAI发布GPT - 5 - Codex,其背后AI Agentic Programming重塑软件开发流水线。介绍了AI Agentic编程定义、典型工作流、技术底座、主流Agent对比分类,还展望未来5大机会。
字节推出全新视频换装框架DreamVVT
视频虚拟试穿技术受关注,但现有方法有局限。字节推出DreamVVT框架,基于扩散变换器,分两阶段试穿,能应对多种复杂场景,不过也存在依赖遮罩、复杂动作表现不稳定等问题。
OmniAvatar震撼开源!阿里夸克开源全新音频驱动角色模型
音频驱动人体动画技术有局限,阿里夸克团队推出OmniAvatar模型。它用逐像素多层次音频嵌入和LoRA训练法,解决唇动同步等问题,适用于多领域,但也存在颜色偏移等不足。