推理质量」共找到 2600 篇相关文章

新闻资讯7

Mythos限测首日破防,论坛玩家猜网址就摸进门了

4月7日,Anthropic新模型Claude Mythos Preview限量发布,当天就有未授权用户猜出在线地址获得访问权限。Anthropic称未发现自身系统受影响,该模型对齐表现较好,但训练有技术错误。

新智元
算法论文8

从最优传输角度训练奖励模型:让 RLHF 学会「忽略错误偏好」丨ICML 2026

浙江大学、小红书、北京大学等团队提出SelectiveRM,基于最优传输训练奖励模型。它重构训练目标,通过选择性分布对齐排除噪声偏好,解决了奖励模型训练中监督信号不可靠的问题,实验验证其有效且泛化能力好。

AI科技评论
新闻资讯8

最新!Karpathy:Vibe Coding只是抬高了地板,真正的战场在这里

Andrej Karpathy在AI Ascent 2026上与红杉合伙人对话,分享自提出“vibe coding”一年来的变化。谈到技术转变、Software 3.0、模型“锯齿状”特征等,还区分了vibe coding和agentic engineering,指出人类需保留品味、判断力等。

AI寒武纪
算法论文8

晶圆级芯片和存算一体结合:中科院提出15万tokens/s晶圆级芯片方案丨ASPLOS'26

当前大模型发展对计算硬件需求增长,数据搬运成隐性开销。中科院团队成果Ouroboros实现晶圆级芯片,解决数据搬运问题,虽面临挑战,但性能与能效表现显著,验证了“存算一体+晶圆级集成”路线可行性。

量子位
新闻资讯7

首创郎园发布五大举措,构建AIGC视听产业全域创新体系

4月17日,首创郎园总经理赵春燕在北影节发布AIGC视听产业朝阳全域创新生态体系,推出5大核心举措,构建完整文化IP市场,激活创新模式潜力,推动大视听产业高质量发展。

郎园Station
产品应用3

Claude Code 桌面版烂爆了,Anthropic 终于把 “100% AI 编码”演砸了

Anthropic将Claude Code做成桌面应用,本值得期待,然而新桌面版却问题频出,如卡顿、崩溃、自动化功能不稳定等,还出现大量基础功能问题。此前Anthropic宣称代码由AI编写比例高,但产品质量堪忧。

InfoQ
开源动态8

目标更重要?国内公司超越Generalist,进化到动作中心世界模型

具身智能圈被Generalist CEO长文刷屏,其称目标比工具标签重要。但国内极佳世界未停于概念争辩,开源“以动作为中心的世界模型”GigaWorld - Policy,重构具身智能底层逻辑,在多方面表现出色。

机器之心
开源动态8

达尔文.skill正式发布,一个无限进化的skill系统!

作者受Karpathy的autoresearch启发,开发了达尔文.skill系统,可自动评估和优化skill。它有五条原则、八维度评分体系,能批量解决skill质量问题,与Anthropic官方工具互补,现已开源。

花叔
算法论文8

AdaGen: 让图像生成模型学会自适应策略

当前主流图像生成模型多步策略依赖手工静态调度规则,存在需大量调参、无法适配样本特性的问题。本文提出AdaGen框架,通过强化学习训练策略网络,在四大生成范式上实现性能提升与效率优化。

机器之心
开源动态8

阿里搞了个全能解析器,文档、图片、音频、视频一锅端

阿里巴巴开源 Logics-Parsing-Omni,用一个模型统一处理文档、图片、音频、视频四种模态,输出结构化 JSON 数据。它采用三级渐进解析框架,两阶段训练策略,在自建基准上多项指标超越 Gemini - 3 - Pro。

CourseAI