操作性条件反射基准」共找到 887 篇相关文章

算法论文8

RAG搜对了却答错?德国萨尔大学找到了真相丨ACL'26

RAG已成大模型落地标配技术,但存在搜到对的文档、模型答案却离谱的痛点。德国萨尔大学等组成的团队诊断出问题在阅读理解,提出Disco - RAG框架,在“搜”和“答”间加“读懂”环节,已被ACL 2026主会录用。

量子位
算法论文8

让大模型基于「图像事实」说话:用事实文本+自适应编辑,让语言偏见无处遁形丨ICLR'26

多模态大模型看图常“脑补”,存在对象幻觉问题。北航团队提出AFTER框架,含FAS和QAO模块,能在主流LVLM和基准上显著降低幻觉,且推理开销低,为多模态助手落地提供实用路径。

量子位
产品应用7

The Batch:924|GPT-5.4:性能更高,价格也更高

OpenAI更新旗舰模型GPT-5.4,有Thinking和Pro两个版本,扩展工具使用能力,多基准测试达当前先进水平,但定价高。虽在部分任务表现超Claude,挑战Gemini地位,不过成本也更高。

DeeplearningAI
开源动态8

字节清华智能体自动写CUDA内核,比torch.compile加速2.11倍

字节Seed与清华AIR团队开源CUDA Agent,在GPU内核优化基准KernelBench上成绩优异。它是大规模智能体强化学习系统,训练数据经多阶段构建,分阶段训练,全面超越商业模型,还开源了训练数据集。

量子位
开源动态8

DeepSeek又拿第一!首创「因果流」视觉推理,超越Gemini

DeepSeek开源DeepSeek - OCR2,引入DeepEncoder V2视觉编码器,打破传统模型扫描限制,模仿人类视觉「因果流」逻辑。它解决了传统VLM忽略图像语义结构问题,在多项测试中表现出色,还验证了「LLM作为视觉编码器」可行性。

新智元
算法论文8

重复一下提示词,Gemini准确率竟从21%飙升至97%!

Google Research团队研究发现,重复提示词可让Gemini准确率从21.33%升至97.33%。该策略能提升主流大模型非推理任务表现,在多模型多基准测试中优势明显,且不增加延迟。

AIGC开放社区
算法论文8

复杂空间推理新SOTA,性能提升55%!中山大学新作SpatialDreamer

中山大学等机构推出SpatialDreamer,模拟人类空间认知过程,构建闭环推理流程,还提出GeoPO解决奖励稀疏问题,构建SpatialDreamer - SFT数据集。实验显示其在多基准达SOTA,为AI空间智能发展开辟新路径。

新智元
新闻资讯8

谷歌最新版「深度研究」反击GPT-5.2

GPT - 5.2发布前,谷歌推出新版Gemini Deep Research Agent,基于Gemini 3 Pro构建,功能强大。还开源DeepSearchQA,推出交互API。此外,DeepMind与英国政府合作,在城市规划、科学研究、网络安全等多领域应用AI技术。

新智元
推荐文章8

DeepSeek V3到V3.2的进化之路,一文看全

知名AI研究者Sebastian Raschka发布深度博客,详细梳理DeepSeek V3到V3.2进化历程。DeepSeek V3.2性能对标GPT - 5和Gemini 3.0 Pro,且为开放权重模型,报告涵盖众多有趣领域和知识。

机器之心
开源动态8

小米开源首个跨域具身基座模型MiMo-Embodied,29个榜单SOTA

小米具身智能团队开源跨域基座模型MiMo - Embodied,它融合自动驾驶与具身智能,在29个榜单创SOTA。该模型基于MiMo - VL架构,采用四阶段训练策略,有效解决领域割裂问题,为通用VLA模型奠定基础。

机器之心