可核验奖励」共找到 4210 篇相关文章

算法论文8

突破高分辨率图像推理瓶颈,复旦联合南洋理工提出基于视觉Grounding的多轮强化学习框架MGPO

先进多模态大模型处理高分辨率图像有瓶颈,复旦和南洋理工研究者提出基于视觉Grounding的多轮强化学习方法MGPO,能让模型精准推理,还使模型从答案反馈中涌现视觉定位能力,避免依赖昂贵标注。

机器之心
新闻资讯7

Anthropic将在两周内推出新思考模型!

据The Information报道,Anthropic将在未来几周推出Claude Sonnet和Claude Opus两款新模型,能在「思考」和「工具使用」间切换,还自动测试纠正代码。虽此前产品有不足,但新模型处理复杂任务更出色。

AGI Hunt
产品应用7

亚马逊云科技 AI 助手终于来了,一出手就对标 Cowork

亚马逊云科技推出 AI 助手 Amazon Quick,对标 Claude Cowork。它是 AI 驱动的桌面办公助手,通过自然语言完成多项办公任务,还能连接多种办公工具,在国内使用体验好,体现了 AI 办公从‘工具增强’走向‘流程重构’。

MacTalk
新闻资讯8

英伟达:RLP 让 AI 在预训练时就学会思考

英伟达研究团队发布 RLP 技术,与传统大语言模型训练不同,它在预训练阶段就让模型学会'先想后说'。通过奖励机制自我监督,实验效果惊人,性能提升显著,不挑数据,打破了大模型训练范式。

AI工程化
产品应用8

OpenAI突然发布Sora 2:好一个“AI版抖音”!

OpenAI重磅上新,带来依托Sora 2的“AI版抖音”——Sora iOS APP。Sora 2是音视频同步生成模型,更遵循物理定律、控性强,还能注入现实元素。实测效果佳但画质低,Pro版改善,后续还会发布API。

量子位
算法论文8

阿里通义发布并行计算新策略:1.6B等效4.4B,内存消耗骤降95%

阿里通义团队提出PARSCALE并行计算新策略,受CFG双路径推理机制启发,将并行思想扩展到训练和推理全流程。能让1.6B模型性能接近4.4B模型,内存占用大降,还用于现有模型,无需从头训练。

量子位
开源动态7

一夜之间,Claude Code删掉了80%系统提示词

本周五,Anthropic 技术团队成员 Thariq Shihipar 介绍新一代大语言模型工程趋势变化。Anthropic 发现旧提示词工程范式在新一代强推理模型发布后或过时,新的 Claude.md 应精简,大砍系统提示词后把特定任务上下文交给 Skill。

机器之心
新闻资讯8

C罗刚头球破门,AI解说脱口而出!全模态实时流太狠了

2026世界杯正热,阿里云在Flink Forward Asia 2026大会宣布Apache Flink 3.0进入Agentic Streaming For AI时代,推出全模态数据流处理能力,让AI实时解说比赛。Flink 3.0解决了流式Agent数据处理难题,已有智能运维等应用场景。

新智元
新闻资讯7

Karpathy:大模型交互的第三种范式来了?这是不是夸大其词

Anthropic 上线 Claude Tag,让团队在 Slack 与 Claude 协作,能完成写 PR、数据分析等任务,有多人协作、积累上下文等特点。Karpathy 认为这是大模型 UI 第三次大改,但评论区有质疑,不过有大咖背书或成‘数字员工’。

AI工程化
产品应用7

设计师的 ChatGPT 时刻:Figma 这次把“设计即代码”玩成现实

文章介绍了AI编程产品分类,指出Vibe Coding存在的问题。重点讲述Figma在2025 Config发布Vibe Coding产品Figma Make,其从设计稿生成网页,有编辑工具精准迭代等功能,还推出视化低代码建设工具Figma Site。

歸藏的AI工具箱