外部验证」共找到 935 篇相关文章

算法论文7

直播预约 | 强化学习训练能否不依赖外部知识优化模型的弱点?

论文提出 SwS 框架,针对强化学习场景,利用模型自我感知弱点驱动自动化问题生成,合成针对性训练数据。还对其进行多项扩展,在多个基准测试集和模型上验证有效,性能提升显著。

深度学习自然语言处理
开源动态8

GPT-4o连验证码都解不了??SOTA模型成功率仅40%

MetaAgentX团队推出Open CaptchaWorld平台,用于测试Agent解验证码能力。实测SOTA多模态模型成功率低,如GPT - 4o也被难住。该平台特点多样,揭示了当前Agent短板及模型设计新方向。

量子位
产品应用8

Claude Opus 4.7发布:更严谨的长任务处理与自我验证能力

Anthropic发布Claude Opus 4.7模型,相比4.6版处理长任务更严谨,能自我验证输出。它在视觉、指令遵循、记忆等能力上提升,企业级应用表现出色,还有新功能与安全特性,不过使用成本更高。

AI工程化
开源动态8

如何科学地“设计”SFT 数据?一次关于 ODA 的完整平台级验证

大模型后训练阶段,SFT数据构建常依赖‘直觉’或‘试错’。上海人工智能实验室OpenDataLab团队发布报告,基于OpenDataArena提出新范式,将数据集构建从‘随机艺术’变为‘确定性工程’,并进行平台级验证

深度学习自然语言处理
算法论文8

直播预约 | SwS: 强化学习训练能否不依赖外部知识优化模型的弱点?

该论文提出强化学习场景下的启发式数据合成流程(SwS),利用模型自我感知弱点驱动自动化问题生成,弥补推理缺陷。对其扩展后适应性更广,在多基准测试集和模型上验证有效,性能提升显著。

深度学习自然语言处理
新闻资讯7

传奇黑客首次造出“透明芯片”,从硬件到代码全部公开可验证

8月初第34届Defcon黑客大会,主办方发放美籍华裔黑客黄欣国设计的徽章,核心是开源微控制器Baochip - 1x。该芯片从设计到制造全开放可验证,用红外原位检测,还集成硬件加固手段,安全性能对标商用元件。

DeepTech深科技
产品应用7

我给剪辑产品 0 元雇了个外部研发部:它开始自进化

作者的剪辑产品有了“外部研发部”——Agent。它每天研究新方法、用真实项目测试。作者三步搭建此“研发部”,让其自动查询、测试和汇报,自己负责最终决策,项目获取新方法不再只靠偶然。

AI产品自由
开源动态8

Specula在67个开源系统中找到382个深层bug,数月形式化验证缩短到几小时

截至2026年8月19日,Specula已在67个开源系统找出382个bug。它让coding agent自动生成TLA + 模型和正确性不变量,运行检查并复现问题,将数月的形式化验证缩短到几小时,降低了形式化方法使用门槛。

机器之心
开源动态8

腾讯AI Lab开源可复现的深度研究智能体,最大限度降低外部依赖

腾讯AI Lab推出全开源智能体框架Cognitive Kernel - Pro,解决现有开源框架依赖付费工具问题。它有模块化架构等核心设计,创新训练方法,在多任务中表现出色,降低外部依赖,相关论文登HuggingFace热榜。

量子位
新闻资讯7

Claude 4如何思考?资深研究员回应:RLHF范式已过,RLVR已在编程/数学得到验证

Anthropic两位研究员在博客采访中透露Claude 4思考细节。提到可验证奖励强化学习RLVR在编程和数学领域获证明,探讨了RL扩展、模型自我意识等,还为大学生给出AI领域建议。

量子位