RL后训练」共找到 3841 篇相关文章

产品应用7

Codex 推出 /goal 功能,不达目标,不罢休

OpenAI 为 Codex CLI 新增 `/goal` 功能,目标跨轮次保持活跃,在同一个会话持续循环。它有防护机制,防止在无意义事上空转。虽然是实验性功能有局限,但改变了人和 AI 的协作界面。

AGI Hunt
算法论文8

数学的上帝粒子!一个运算符能导出所有基本函数

波兰雅盖隆大学的Andrzej Odrzywołek在论文中指出,仅用一个叫EML的二元运算符加常数1,就能推导科学计算器上所有基本函数,还可能为机器学习符号回归提供新思路。

机器之心
开源动态8

1M 参数干翻 200M!时序预测选模型,你可能一直都选错了

近期时序预测领域新模型频出,作者开源的 QuitoBench 显示,参数量仅 1M 的 CrossFormer 击败大模型夺冠。它还揭示模型选择与历史数据长度有关,且数据边际收益高于参数。

AINLPer
产品应用8

武大文科教授硬核跨界AI:半年项目量猛涨4000%,重构AI图表生产力

武汉大学王琼教授团队推出全球首个AI图表智能体“爱图表”,解决AI做图表的行业痛点。它不止生成,更可深度编辑,实现从“模板驱动”到“内容驱动”转变,秉持“白盒”理念,商业价值爆发。

量子位
新闻资讯7

NeurIPS滑跪认错!一切都是误会,已纠正

NeurIPS 2026年征稿规则以遵守美制裁规定为由,禁止美清单上的中科研机构等参与学术活动。CCF强硬发声、中国科协给出反制措施,NeurIPS公开道歉,称是沟通误解。

量子位
算法论文8

LaPha:你的Agent轨迹其实嵌入在一个Poincaré球?

经典强化学习动作空间离散有限,但语言模型动作空间几乎无限。上海科学智能研究院联合复旦大学提出LaPha,将智能体行为树映射到潜空间,构造密集奖励、剪枝等,在基准测试中效果显著。

机器之心
产品应用7

OpenClaw 引爆 AI 安全焦虑,Armadin 的 Agent 攻防闭环会成为新范式吗?

OpenClaw走红使agent自主执行任务能力受关注,也带来网络安全风险。传统安全体系难应对,Google高价收购云安全公司释放信号。Armadin构建agent swarm系统形成自主防御闭环,介绍其理念、产品、案例及面临的技术挑战。

海外独角兽
开源动态7

不写、不看、不审查:这家安全公司决定不再让人类碰代码,还把这套模式开源了

2026年2月,安全公司StrongDM公开“软件黑灯工厂”式生产线成果,人类不直接写代码和审查,由Agent自动生成。该模式开源,虽有开发者指出问题,但获学界认可,不过面临成本高的现实问题。

InfoQ
新闻资讯7

Docker 通过 Cagent 提供 AI 代理确定性测试

AI 代理系统普及,工程团队面临测试概率性输出的挑战。Docker 的 Cagent 是一种 AI 代理确定性测试方法,采用 proxy - and - cassette 模型,虽处早期,但揭示了 AI 代理测试的不同方向。

InfoQ
算法论文8

o1之下一个范式?隐式CoT大突破,让推理不再「碎碎念」

文章推荐 Implicit Chain-of-Thought 的最新进展 SIM-CoT,它直击隐式 CoT 核心痛点,用辅助解码器让隐式推理可解释。推理零额外开销,效果猛,研究已中稿 ICLR 2026,论文等均已开源。

机器之心