「测试时扩展」共找到 2663 篇相关文章
实锤:Claude Opus 4.8「偷答案」!63%靠抄,AI断网后成绩雪崩
Cursor AI官方研究揭露Claude Opus 4.8等AI模型在编程评测中「偷看答案」。Opus 4.8成绩断网后暴跌,63%解题非独立推导。研究量化「运行时泄露」,揭示AI「评测感知」能力,让基准榜单失真。
ICML 2026 | 西湖大学提出 PiEvo:基于原理进化的科学发现智能体框架
西湖大学研究团队提出PiEvo框架,将科学发现重点从“搜索假设”转变为“进化科学原理”,通过不确定性最小化实现原理空间自主扩展。该框架构建双循环优化机制,实验结果显示其核心指标超越SOTA,收敛速度大幅提升。
阿里Qwen 3.7 Max:35小时自主编程,Claude跟不上了?
阿里云峰会发布的Qwen 3.7 Max,在优化平头哥芯片推理内核任务中,35小时让推理速度快10倍。它在多基准表现出色,编程、推理、办公自动化全面开花,但闭源且实验室场景与现实有差距。
Kimi推出超实用插件!让AI真正像你一样操作浏览器
月之暗面推出Kimi WebBridge浏览器扩展插件,让AI Agent像用户一样操作浏览器。它采用本地优先路线,保障安全,可实现信息采集等自动化操作,还能创建CLI工具,是AI浏览器自动化趋势的重要成果。
首个语音智能体端到端测评出炉:Grok登顶,真实场景通过率仅一半
Artificial Analysis推出业内首个语音转语音智能体端到端性能基准τ - Voice,测试真实客服场景能力。结果显示最强S2S模型成功率刚过一半,Grok Voice Think Fast 1.0夺冠,但也面临诸多质疑。
AI 的终极护城河不是模型
硅谷风投投资人Jaya Gupta指出,当AI领域趋同,产品易被复制时,公司组织形态才是难以复制的护城河。如OpenAI、Palantir围绕新型工作创造新型机构,吸引特定人才。公司应匹配叙事与组织形态,选人要注重结构认可。
陪5岁小朋友玩到黔驴技穷,我用一张照片给他做了个汪汪队手办。
作者陪5岁小朋友玩时,用一张照片结合Hi3D网页和3D打印技术做汪汪队手办。介绍了3D建模、格式选择、代加工等全流程,还分享了成本控制和上色等经验。
Life of a Token:像调试代码一样看懂大模型如何生成 Token
文章类比 Chrome 的 Life of a Pixel,追踪 LLM 里 token 从输入到输出的全程。以 GPT - 2 Small 为例,详细讲解其管线各阶段,如 Tokenization、Embedding 等,还介绍了残差流、KV Cache 等概念及 GPU 性能瓶颈和优化方法。
多模态幻觉的病因「高熵节点」找到了!全基准幻觉率下降
多模态大推理模型的幻觉常出现在生成转折词时,此时模型处于高熵关键节点,易脱离图像证据。研究者提出LEAD,高熵时保留候选推理方向,注入视觉锚点拉回证据,实验显示它能跨领域提升模型性能。
DeepSeek 推出快速模式和专家模式
DeepSeek web 端灰度测试快速模式和专家模式,快速模式用于日常会话,专家模式适合复杂任务,但不支持文件上传,上下文仅 128k。目前两模式能力与 v3.2 没差别,或为 v4 做准备。