测试范式」共找到 2589 篇相关文章

新闻资讯7

退钱!Claude 4.8连夜大降智,GPT-5.6算力遭「腰斩」

最近AI社区遭遇集体降智潮,OpenAI疑似暗中开启GPT - 5.6灰度测试,克扣用户思考预算;Anthropic的Claude Opus 4.8被曝断崖式降智,性能不如旧版。或因SpaceX上市抽干流动性,巨头降本增效。

新智元
新闻资讯8

哈佛《Science》研究:大模型已碾压人类医生!

哈佛医学院等团队让OpenAI o1系列大模型与数百位医生在多项测试中较量,大模型在各项诊断和管理推理任务上全面超越人类专家,不过当下模型处理非文本信号有局限。

AIGC开放社区
新闻资讯8

我国Chiplet产业的真实水位与全产业链突围

国内Chiplet市场快速增长,但与国际仍有差距。国家和地方给予政策与资金支持,多个联盟推动标准化。企业在设计、封测、EDA等领域积极布局,但面临核心技术、设计测试、产业链协作等挑战。

芯师爷
产品应用7

Qwen“半成品”推理模型刷下AIME满分,俘获大批国外开发者!实测碾压GPT-5 Thinking、还能写侦探小说

阿里发布 Qwen3-Max-Thinking 早期预览版,虽是‘半成品’,在数学推理竞赛中达 100% 正确率。Qwen3-Max-Preview 多项测试领先,速度超 ChatGPT,还成 AnyCoder 默认选项,但未开源。实测表现有优有劣。

AI前线
开源动态7

「看」能否取代「读」,为何DeepSeek-OCR 爆火的重点不在性能?

DeepSeek近期开源的DeepSeek - OCR在AI社区引发热议。它提出‘上下文光学压缩’理念,以视觉方式压缩文本。社区关注重点在其研究思路对NTP范式的影响,有望解决长上下文经济性难题等。

机器之心
产品应用8

Claude Skills,4000字详解 Anthropic 的思考

Anthropic推出新技能Claude Skills,作者认为它会引导第三方工具形态。Skills结合笔记式形态、可执行工具与AI调度自优化,具备低门槛、灵活表达等优势,还实现了AI自我进化,是一种新范式

AI产品自由
开源动态8

Meta最新REFRAG框架引爆RAG圈!KV缓存暴降90%,速度狂飙30×

Meta推出REFRAG框架解决RAG难题。它能在不修改解码器参数下压缩上下文、复用文档向量等。实验显示,它降低KV缓存、加速TTFT,在多任务表现佳,为大模型与知识库结合提供新范式

CourseAI
算法论文8

3D-R1:让AI理解3D世界的下一步

文章介绍新研究3D - R1,它是更通用、具推理能力的三维视觉语言模型,解决了当前3D VLM空间理解不足与推理能力薄弱问题,在多任务测试领先,有广阔应用前景。

机器之心
8

GPT-5实锤,悄悄上线代号「龙虾」!版本号曝光,实测编程惊人能改屎山代码

代号「龙虾」的神秘模型在WebDev Arena现身,网友猜测是GPT - 5,提前试用者称其编程能力惊人,能改屎山代码。多位用户表示其在代码生成等方面超越Claude,OpenAI或已秘密测试

新智元
算法论文8

如何将LLM的"思考习惯"迁移到视觉领域?

传统多模态模型处理复杂视觉推理能力不足,OVR团队以Qwen2.5 - VL - 7B为基础构建开源强化学习框架,成果模型OVR在12个基准测试刷新记录,揭示认知行为跨模态迁移三条黄金定律。

深度学习自然语言处理