代码强化学习」共找到 3001 篇相关文章

产品应用7

自动化评测的九九归一——评测agent

本文提出统一评测Agent架构,实现评测全链路自动化。它能学习标注标准,完成自动标注等工作。还介绍架构、解耦方法、模型优化及训练方案,解决多模态幻觉等问题,提升机审率,节省标注成本。

阿里云开发者
新闻资讯7

AI看不懂的色盲测试背后,藏着一场像素与诗意的战争。

作者和同事测试AI色盲测试图,多模态模型Gemini 3 Pro、Claude Opus 4.5等纷纷答错,仅GPT 5.2 Thinking答对且靠代码作弊。研究发现,AI看图断章取义,缺乏人类的“格式塔”能力。

数字生命卡兹克
算法论文7

The Batch: 899 | 更划算的推理

研究人员提出 Delethink 强化学习方法,训练大模型定期截断推理 token 至固定最大数量,以限制处理长思维链成本。经测试该模型在多方面超基线,且缓解计算成本限制,为长上下文推理提供路径。

DeeplearningAI
开源动态7

上新:Cache-DIT 支持LTX-2模型

作者和DefTruth在Cache-DIT上支持了LTX-2模型,记录适配关键点,包括模型侧、框架侧适配。介绍LTX-2特点,如支持T2V/I2V、输出带音频,还说明Cache-DIT加载区分T2V/I2V方法及cache侧修改内容,最后给出使用示例。

GiantPandaLLM
新闻资讯8

DeepSeek V4爆春节登场!四大杀招突袭全球编程王座,Claude危

据爆料,DeepSeek计划在2月中旬春节前后发布V4模型,剑指编程王座。其在编程能力、超长上下文代码处理、算法提升、推理能力上有突破,或延续高性价比路线,在受限硬件下靠算法取胜。

新智元
推荐文章7

从HITL(Human In The Loop) 实践出发看Agent与设计模式的对跖点

本文围绕在 ReactAgent 中引入并实践 HITL 机制展开,介绍实现方案与代码设计。分析无通用人机协同时的问题,阐述 HITL 核心要点、实现效果与细节,还探讨 Agent 演进与工程设计模式的关联。

阿里云开发者
算法论文8

普林斯顿大学等Nature揭秘:人类大脑与大语言模型共享同一套语言处理时钟

普林斯顿大学等机构研究发现,大语言模型层级计算序列精确映射人类大脑处理语言的毫秒级时间动态,其与人类大脑理解语言的先后顺序高度一致,为理解大脑和开发神经网络架构开辟途径。

AIGC开放社区
产品应用8

OpenAI:如何用 Codex 在 28 天内极速打造安卓版 Sora

OpenAI发布工程博客,揭秘用Codex不到一个月打造Sora安卓版应用的过程。这款应用上线首日冲至Google Play下载榜第一,24小时内用户生成超百万视频,开发过程耗约50亿tokens,崩溃率仅0.1%。

AGI Hunt
产品应用7

实测完豆包Seedream 4.5,替我设计师朋友哭了

火山引擎推出图像创作模型Doubao - Seedream - 4.5,有强化原图保持、多图组合生成、优化海报排版与Logo设计等主打点。经实测效果不错,已全量开放API并公测,官方还给出生图tips。

量子位
新闻资讯8

Anthropic官宣PTC突破,中国开发者一年前就实现了

2025年11月24日,Anthropic发布PTC特性,让Claude通过代码编排工具执行。但国产minion框架早有类似架构,不仅将此作为基础架构,还支持Python生态、状态管理等功能,在实际应用中更高效灵活。

新智元