验证预算」共找到 887 篇相关文章

算法论文8

无需验证器的RL:RLPR解锁LLM通用推理潜能

现有依赖强化学习与可验证奖励(RLVR)提升大语言模型(LLM)推理能力的方法,受限于领域特定验证器。本文提出RLPR框架,利用LLM生成正确答案的固有概率作奖励信号,实现无需外部验证器的通用领域强化学习,效果显著。

深度学习自然语言处理
算法论文8

超越Claude Mythos和GPT-5.5!斯坦福Agent验证框架拿下SOTA,Transformer作者转发

斯坦福、伯克利与英伟达联手打造LLM-as-a-Verifier验证框架,该方法是通用验证机制,可与任意Agent Harness和模型结合。研究表明扩展验证阶段计算量,能提升Agent整体性能,在多基准测试中超越Claude Mythos和GPT - 5.5。

量子位
新闻资讯7

突发:Claude引入强实名制验证!必须真人手持证件自拍,否则直接封号!

Anthropic宣布在Claude平台推出身份验证功能,部分用户访问特定功能或触发风控时需强制验证,要手持证件自拍。这一举措让中国用户账号风险大增,还可能冲击相关生态链,用户或转向ChatGPT。

新智元
产品应用8

从日志学习到风洞验证:构建 GPU 集群的 AI Native 稳定性闭环

文章介绍了面向新引入GPU芯片稳定性验证的AI Native治理体系“算力风洞”。其通过厂商环境自动复刻等手段,将新芯片适配效率提升10倍以上。体系分认知、验证、进化三层,形成完整闭环,推动智算集群稳定性建设升级。

阿里云开发者
算法论文8

视频「缺陷」变安全优势:蚂蚁数科新突破,主动式视频验证系统RollingEvidence

蚂蚁数科AIoT团队论文提出主动式可信视频取证系统RollingEvidence,利用相机卷帘门效应嵌入物理水印,结合AI与概率模型验证,抵御伪造篡改,在检测准确率和防护能力上优于传统技术。

机器之心
算法论文8

攻克AI过度思考难题!美团新研究让通过“可验证”过程奖励激活LRM的高效推理

美团等机构研究团队针对LRM“过度思考”问题,提出可验证的过程奖励机制(VSRM)。它结合可验证奖励与步骤级奖励,为推理步骤分配奖励信号。实验显示其能降低输出长度并保持性能。

量子位
算法论文8

只需1/4预算,性能反超基线:阿里高德提出Tree-GRPO,高效破解智能体RL难题

阿里高德提出Tree - GRPO方法解决智能体RL难题。它以智能体步骤为节点树搜索,在11个数据集中更省预算、表现更好,能在1/4预算超GRPO基线,解决了Rollout成本高和监督稀疏问题。

机器之心
新闻资讯7

微软叫停Tokenmaxxing!预算卡死,超限自负

从今年7月起,微软为各业务部门设「AI Token预算目标」,将GPT - 5.6设为内部默认模型。此前Tokenmaxxing风靡硅谷,如今大厂纷纷收紧AI使用,微软是最后跟进者之一。

量子位
算法论文8

拒绝「降智、减配、乱收费」:面向LLM API的可信验证框架

大语言模型成AI应用基础设施,黑盒服务模式引发信任危机。研究者提出IMMACULATE审计框架,能在不暴露模型信息、仅1%额外开销下,验证黑盒LLM API执行完整性,检测违规行为,相关论文与代码已公开。

机器之心
产品应用8

预算有限、技术空白:最刁钻的AI用户,是中小企业老板

2026年大模型在中小企业办公环境中应用不佳,工具与场景脱节。华为云推出专为中小企业的Flexus AI智能体平台,它依托自研模型,在多场景准确率领先,已在多行业验证效果,还能辅助内容创作。

InfoQ