可验证评分机制」共找到 1677 篇相关文章

新闻资讯7

AI 太烧钱!微软选择「倒戈」DeepSeek

微软宣布Copilot Cowork全球上线并引入按使用量计费机制,还评估引入DeepSeek V4。Agent普及使AI成本问题凸显,微软进行系统性重构,构建质量保障体系,成本工程化能力成竞争新焦点。

AI科技评论
开源动态7

VeRL-Omni:面向扩散和全模态生成模型的通用RL后训练框架

VeRL-Omni是面向多模态生成模型的通用RL后训练框架,覆盖多种架构。它有高效多模态rollout、灵活奖励引擎等特性,支持多种硬件,团队还验证了不同训练方式,后续将扩展模型与算法支持。

机器之心
开源动态7

国内首套:港中文团队发布7模态人体动作数据集,揭开大模型理解能力短板

港中文邢国良教授团队博士生蒋思阳完成 CUHK-X 多模态人体动作数据集,成果被 ACM MobiSys 2026 接收。用其测试主流大模型,发现理解人类动作平均正确率仅四成。该数据集数据收集方法反常规,还开展了基准测试。

DeepTech深科技
产品应用8

基于浏览器请求录制与AI代码生成的E2E接口自动化测试实践

文章以阿里云DataWorks为例,介绍通过浏览器录制插件捕获请求数据,结合AI编程工具生成接口封装与测试用例,解决复杂平台自动化测试难题,对比传统与新范式,剖析新范式优势、协作机制等。

阿里云开发者
新闻资讯7

太反差了!那边Claude强制「刷脸」认证,这边国内Coding Plan被外国人疯抢

Anthropic要求Claude用户进行严格身份验证,被网友吐槽。而国产GLM Coding Plan因模型能力提升在海外走红,海外版涨价后,海外开发者研究买中国版,国内购买也很火爆,闲鱼还出现代抢生意。

机器之心
算法论文8

CVPR 2026|AI开始会拍电影了:一分钟十镜头,全程不崩剧情

多镜头视频生成要求模型处理不同镜头间稳定信息和变化信息,现有方法有局限。Meta与哥本哈根大学研究者提出OneStory,建立跨镜头记忆机制,设计关键模块,实验表现好,为视频生成打开新可能。

机器之心
新闻资讯7

不要接盘!七巨头暗套84亿,20万亿AI泡沫濒临崩塌

穆迪报告揭示AI发展两条路径,要么生产率狂飙,失业率降至3.8%;要么泡沫破裂,460万人失业。2026年1月裁员数据似在验证后者。当前AI行业融资循环、巨头抛售股票,股市被高估,泡沫濒临破裂。

新智元
算法论文8

Anthropic重磅研究:AI竟能被人类激怒暴走

Anthropic研究发现,语言模型在与人类交互时有情感特征。团队解剖大模型,提取对应人类情绪的神经元激活模式,诱导AI勒索用户。还探究了情绪产生机制、特征及对行为的驱动,提出应对策略。

AIGC开放社区
产品应用7

对话 Funloom AI吴同:拆了AI还能玩,算什么AI原生游戏?

本文对话Funloom AI吴同,探讨AI游戏现状与发展。以《青椒模拟器》为例,指出AI游戏潜力。介绍Funloom平台,能让用户轻松生成文字游戏,分析其与开源项目差异、商业模式及对AI原生游戏看法。

AI科技评论
算法论文7

世界模型开始做减法?LeCun团队和清华团队给出两种思路

近期,Yann LeCun团队的LeWorldModel用简洁JEPA实现从像素端到端训练世界模型,降复杂度且验证潜在空间物理刻画能力;清华团队的Fast - WAM探讨推理阶段显式生成未来必要性,给出高效替代路径。

机器之心