「测试范式」共找到 2589 篇相关文章
OpenAI重新开源!深夜连发两个推理模型,o4-mini水平,笔记本、手机可跑
OpenAI 自 GPT - 2 后重新开源,此次连发两个推理模型 gpt - oss - 120b 和 gpt - oss - 20b。它们性能达 o4 - mini 水平,可在笔记本、手机运行,有宽松许可等亮点,在多测试中表现出色。
4K-Agent:可将低分辨率图像提升至4K高清智能体
图像超分辨率技术在多种视觉任务中重要,但传统方法泛化能力有限。德克萨斯A&M等大学研究人员推出4K Agent,其多智能体架构能将低分辨率图像提至4K高清,在多领域测试表现出色。
社区供稿 | GLM-4.5技术博客:原生融合推理、编码和智能体能力
文章介绍 GLM-4.5 和 GLM-4.5-Air,二者旨在统一推理、编码和智能体能力。在 12 个基准测试中表现良好,采用 MoE 架构等技术,还开源 slime 框架。文中展示其多方面应用,并说明使用方式。
Speech-02语音模型登顶国际榜单:完美复刻声音,同事听后难辨真伪
MiniMax的Speech-02语音模型登顶国际榜单,超越OpenAI等海外模型。它引入可学习说话人编码器,有高扩展性,还能结合文本描述生成音色。测试显示其音色丰富、读音准、支持多语种,声音复刻逼真。
北大联合阶跃星辰提出TensorCast:统一可编程管理大模型张量,推理「首字延迟」最高降低93.2%
随着模型规模增长、新应用兴起,大模型基础设施面临管理「张量状态」挑战。北大、阶跃星辰与北邮联合提出 TensorCast,解耦张量状态,复用管理能力,在多场景测试中表现出色,为大模型基建提供新范式。
RoboChallenge发布年度报告:评测标尺够权威吗?
当下具身智能行业存在缺乏真实场景验证、评测标准模糊等问题。2025年原力灵机与Hugging Face推出RoboChallenge评测平台,2026年1月更新榜单。AI科技评论从技术和核心设计角度对其进行深度拆解。
Claude统治一切!吞下这颗红药丸,焊工也是顶尖程序员
一种被称为「Claude - pilled」的现象在硅谷蔓延,焊工、律师等非程序员用Claude Code写APP,程序员护城河渐崩。但工程师用它后学习速度下降,社区探索让AI成导师的办法,且软件开发范式正转变。
人类记忆 vs 大模型记忆,到底差在哪?
这篇发表于 2025 年 10 月《Trends in Cognitive Sciences》的文章,探讨用人类“情景记忆”研究成果改进记忆增强型大语言模型。指出现有 AI 记忆系统存用数据低效,呼吁构建“类人情景记忆”AI,还剖析差异并给出评估方法和展望。
快手Klear-Reasoner登顶8B模型榜首,GPPO算法双效强化稳定性与探索能力!
快手Klear团队推出Klear-Reasoner模型,基于Qwen3 - 8B - Base打造,在多基准测试达同规模SOTA。其核心GPPO算法能强化稳定性与探索能力,团队还对训练流程多环节深入分析,给出优化策略。
OpenAI刚刚发布GPT-5,免费使用、疯狂屠榜,一夜改写AI历史
今天凌晨1点,OpenAI发布GPT - 5,采用内嵌式三位一体集成架构,有创新的实时决策路由机制。免费版ChatGPT可使用,有额度限制。测试显示其在多领域大幅超越前代,应用开发能力强,今日向部分用户推出。