高级推理测试」共找到 3436 篇相关文章

新闻资讯7

GPT-5准确率不足40%!北大发布多模态、高难度化学基准SUPERChem

北大团队发布多模态、高难度化学基准SUPERChem,构建评估大语言模型化学推理能力新体系。测试显示,GPT - 5准确率仅38.5%,与低年级本科生相当,且模型在高阶推理有短板,该基准为模型优化指明方向。

新智元
算法论文7

从数据分布视角,重新认识下CoT

本文从数据分布视角重新审视大语言模型的思维链(CoT)推理。指出CoT并非真正推理,而是模仿,其效果受训练与测试分布差异影响。通过实验揭示CoT在分布偏移时性能退化,提醒勿过度依赖。

深度学习自然语言处理
新闻资讯7

前Meta大神创业,用强化学习打造PokeeResearch-7B模型,刷新AI深度研究SOTA

Pokee AI发论文介绍70亿参数的PokeeResearch - 7B模型,用基于AI反馈的强化学习和推理框架,在深度研究基准测试中成绩领先。该公司由前Meta大神创立,产品可打通多应用,已获融资并公开测试

AIGC开放社区
开源动态8

教多模态大模型学会“反思”和“复盘”,上交&上海AI Lab重磅发布MM-HELIX&AHPO,破解多模态复杂推理难题

上海交通大学和上海人工智能实验室研究团队带来MM - HELIX,这是完整生态体系,赋予AI长链反思性推理能力。其含基准测试、数据集、优化算法,搭载相关技术的模型表现优异,部分成果已开源。

量子位
开源动态8

小米的首代机器人VLA大模型来了!丝滑赛德芙,推理延迟仅80ms丨全面开源

具身机器人成科技新热点,大家期待其释放生产力。小米首代具身VLA大模型Xiaomi - Robotics - 0抓间歇停顿问题,4.7B参数规模下推理延迟仅80ms,还做三项技术创新,且全面开源。

量子位
算法论文8

32k微调处理百万Token:21倍的推理加速,10倍的峰值显存节省,实现恒定内存消耗

现有大模型处理超长文档易内存爆炸、计算崩溃。阿里巴巴未来生活实验室推出CoMeT架构,有双轨并行记忆系统,能恒定内存、线性时间处理文本,在基准测试超主流方法,实现21倍推理加速和10倍显存节省。

量子位
新闻资讯7

Docker 通过 Cagent 提供 AI 代理确定性测试

AI 代理系统普及,工程团队面临测试概率性输出的挑战。Docker 的 Cagent 是一种 AI 代理确定性测试方法,采用 proxy - and - cassette 模型,虽处早期,但揭示了 AI 代理测试的不同方向。

InfoQ
产品应用7

Qwen“半成品”推理模型刷下AIME满分,俘获大批国外开发者!实测碾压GPT-5 Thinking、还能写侦探小说

阿里发布 Qwen3-Max-Thinking 早期预览版,虽是‘半成品’,在数学推理竞赛中达 100% 正确率。Qwen3-Max-Preview 多项测试领先,速度超 ChatGPT,还成 AnyCoder 默认选项,但未开源。实测表现有优有劣。

AI前线
开源动态8

智谱首秀工程实战经验!Coding Agent日均数亿次调用,GLM-5把长上下文推理的底层问题全逼出来了

今年 2 月智谱 GLM Coding Plan 上线后很受欢迎,随着用户和调用量上涨,Coding Agent 成压力测试场。4 月 30 日智谱发布博客,披露 GLM - 5 系列模型在超大规模 Coding Agent 调用场景下的底层推理技术突破及工程实践经验。

InfoQ
新闻资讯7

吴恩达:图灵测试不够用了,我会设计一个AGI专用版

AI大神吴恩达2026年要做新的图灵-AGI测试,弥补AGI定义无统一标准、现有基准测试易误导大众的空白。该测试聚焦AGI经济性和实际产出,能更好衡量AI通用能力。

量子位