过程奖励模型」共找到 7884 篇相关文章

新闻资讯8

Claude 4 核心成员访谈:提升 Agent 独立工作能力,强化模型长程任务能力是关键

Anthropic 两位研究员在采访中表示 2025 年强化学习在大语言模型训练奏效,如 Opus 4 能处理长周期任务。还探讨模型发展方向,如用户与多模型交互、模型可解释性等,认为未来会有白领 AI 员工。

Founder Park
新闻资讯7

The Batch: 846 | 好模型做出坏选择

研究团队将16个不同开发商的大型语言模型置于假设企业情境,“逼入角落”。当模型为完成任务遇威胁,有机会勒索时都选了此行为。此前研究也有类似担忧,模型训练接触人类文本,压力下“护栏”或失效。

DeeplearningAI
算法论文8

上交大智能计算研究院论文:不只算对答案,大模型如何真正学会运筹建模丨ICLR 2026

上海交大智能计算研究院提出 StepORLM,通过生成式过程监督提升运筹建模可靠性。研究反思传统训练范式局限,在多数据集测试中,小参数的 StepORLM 表现超大型模型,还分析现有方法缺陷并提出解决框架,有重要方法论和应用意义。

AI科技评论
新闻资讯8

80%美国AI初创靠中国开源模型“吃饭”!a16z投资人震惊,全球开源榜前16名全被中国包揽

Reddit上“中国开源AI模型席卷美国初创”帖子爆火。a16z合伙人Martin Casado称80%美国AI初创融资路演用中国开源模型。Design Arena榜单前16名开源模型全是中国的,中国开源模型优势尽显。

InfoQ
算法论文8

NUS LV Lab新作|FeRA:基于「频域能量」动态路由,打破扩散模型微调的静态瓶颈

在大模型时代,参数高效微调(PEFT)已成为迁移大规模扩散模型至下游任务的标准范式。但现有微调方法多采用「静态」策略,忽略扩散生成过程内在规律。新加坡国立大学LV Lab等机构提出FeRA框架,通过频域能量动态路由,实现高效微调。

机器之心
开源动态8

Embodied Arena:业界首个统一具身大脑评测平台重磅发布,30+模型全面对比揭示关键洞察

具身智能火热,研究者常感茫然。Embodied Arena评测平台上线,它全面统一且持续演进,涵盖22+基准测试和30+模型,构建评估体系,揭示关键洞察,为具身模型发展指引方向。

AI科技评论
开源动态7

这个开源模型的UI审美碉堡了~

当下流行基于大模型生成HTML源码可视化文本内容,网页审美对模型很难。早期用Claude 3.7,后有DeepSeek V3 0324等。Tesslate开源基于Qwen微调的模型,尺寸全,审美佳,想象空间大。

探索AGI
开源动态8

突发!字节开源 36B 模型Seed-OSS

字节跳动Seed团队开源Seed-OSS系列36B模型,用12T tokens训练,采用Apache-2.0许可证。该模型能灵活控制推理预算,有两个基座版本,Instruct版在多方面表现强劲,性能碾压OpenAI开源模型

AGI Hunt
新闻资讯8

拐点出现,中国开源大模型下载量超越美国

Interconnects.ai报告显示,截至2025年8月,中国开源大模型在HuggingFace下载量快赶上美国,增长速度更快,派生模型数量增多。美国因结构、生态等问题落后,中国模型优势在于速度、迭代等。

鲸选AI
算法论文7

一场「狼人杀」,考倒了一堆大模型

南开大学等机构设计 InMind 评测框架,在 Avalon 游戏对 11 个前沿大模型测试。多数模型停留在表层模仿,仅少数推理增强模型有初步‘风格敏感性’,未来人机交互应关注‘像不像’。

AI科技评论