「Coding测试」共找到 2555 篇相关文章
缺数据也能拿SOTA?清华&上海AI Lab破解机器人RL两大瓶颈
现有机器人视觉 - 语言 - 动作(VLA)模型训练范式存在数据采集成本高、泛化能力不足等问题。清华和上海AI Lab团队提出SimpleVLA-RL,解决了VLA模型训练的核心瓶颈,在多基准测试中实现SoTA性能。
The Batch: 865 | 机器人外科医生的切割与夹闭
约翰·霍普金斯大学等团队开发Hierarchical Surgical Robot Transformer(SRT - H),结合两个transformer模型,通过模仿学习训练,用达芬奇机器人完成胆囊切除关键步骤。虽在体外组织测试表现好,但应对人体手术仍有挑战。
OpenAI重新开源!深夜连发两个推理模型,o4-mini水平,笔记本、手机可跑
OpenAI 自 GPT - 2 后重新开源,此次连发两个推理模型 gpt - oss - 120b 和 gpt - oss - 20b。它们性能达 o4 - mini 水平,可在笔记本、手机运行,有宽松许可等亮点,在多测试中表现出色。
4K-Agent:可将低分辨率图像提升至4K高清智能体
图像超分辨率技术在多种视觉任务中重要,但传统方法泛化能力有限。德克萨斯A&M等大学研究人员推出4K Agent,其多智能体架构能将低分辨率图像提至4K高清,在多领域测试表现出色。
社区供稿 | GLM-4.5技术博客:原生融合推理、编码和智能体能力
文章介绍 GLM-4.5 和 GLM-4.5-Air,二者旨在统一推理、编码和智能体能力。在 12 个基准测试中表现良好,采用 MoE 架构等技术,还开源 slime 框架。文中展示其多方面应用,并说明使用方式。
Speech-02语音模型登顶国际榜单:完美复刻声音,同事听后难辨真伪
MiniMax的Speech-02语音模型登顶国际榜单,超越OpenAI等海外模型。它引入可学习说话人编码器,有高扩展性,还能结合文本描述生成音色。测试显示其音色丰富、读音准、支持多语种,声音复刻逼真。
Claude统治一切!吞下这颗红药丸,焊工也是顶尖程序员
一种被称为「Claude - pilled」的现象在硅谷蔓延,焊工、律师等非程序员用Claude Code写APP,程序员护城河渐崩。但工程师用它后学习速度下降,社区探索让AI成导师的办法,且软件开发范式正转变。
快手Klear-Reasoner登顶8B模型榜首,GPPO算法双效强化稳定性与探索能力!
快手Klear团队推出Klear-Reasoner模型,基于Qwen3 - 8B - Base打造,在多基准测试达同规模SOTA。其核心GPPO算法能强化稳定性与探索能力,团队还对训练流程多环节深入分析,给出优化策略。
OpenAI刚刚发布GPT-5,免费使用、疯狂屠榜,一夜改写AI历史
今天凌晨1点,OpenAI发布GPT - 5,采用内嵌式三位一体集成架构,有创新的实时决策路由机制。免费版ChatGPT可使用,有额度限制。测试显示其在多领域大幅超越前代,应用开发能力强,今日向部分用户推出。
突发,Fable 5.1泄露了!Claude又叒叕全球大宕机
今日,Fable 5.1被曝开启灰度测试,部分Claude用户已免费试用。推测其可能很快全量推送且不涨价。此前Fable 5因性能强受限,开发者期待5.1版。同日Claude全球大宕机,Anthropic正冲刺万亿估值。