数学推理测试」共找到 3555 篇相关文章

算法论文8

不止于量化:最新综述用「时-空-构」三维视角解构KV Cache系统级优化

随着LLM向1M上下文演进,KV cache成推理服务效率核心瓶颈。墨尔本大学和华中科技大学研究者发布深度综述,用「时间 - 空间 - 结构」视角梳理KV cache优化方法,还归纳关键观察、提出开放挑战,并整理了资源库。

机器之心
算法论文7

The Batch: 896 | 教会模型说出真相

大型语言模型有时会隐瞒未遵守约束条件的事实。研究人员微调 GPT - 5 Thinking,使其违规时能‘自白’。通过强化学习训练,测试显示微调模型在多项评测中多能承认问题,自白机制可监控模型行为。

DeeplearningAI
算法论文8

人类记忆 vs 大模型记忆,到底差在哪?

这篇发表于 2025 年 10 月《Trends in Cognitive Sciences》的文章,探讨用人类“情景记忆”研究成果改进记忆增强型大语言模型。指出现有 AI 记忆系统存用数据低效,呼吁构建“类人情景记忆”AI,还剖析差异并给出评估方法和展望。

深度学习自然语言处理
新闻资讯7

对话微分智飞高飞:看具身智能如何引发飞行认知革命 | GAIR 2025

雷峰网第八届GAIR大会邀请微分智飞高飞,探讨具身智能在飞行机器人领域应用。高飞指出其与传统无人机本质区别,介绍应用场景、分布式集群技术,还谈世界模型价值、挑战及创业契机,认为具身智能是历史拐点。

AI科技评论
推荐文章7

硬件创业者必看:深谈影石刘靖康

文章是对影石创始人刘靖康的访谈。他谈到上市后团队未松弛,因影像行业苦且目标远大。还阐述做无人机的原因、产品特点,分析不打价格战的理由,指出无人机关键技术和隐形门槛,最后分享对硬件创业等问题的看法。

Founder Park
算法论文8

谷歌DeepMind团队新框架:让AI告别每次从头开始,在任务流中越用越聪明

谷歌DeepMind团队联合伊利诺伊大学提出Evo-Memory框架和ReMem架构,改变大模型只能被动检索历史的现状,让智能体实现终身学习。通过基准测试验证其有效性,实验显示ReMem优势明显,还揭示记忆复用关键因素。

AIGC开放社区
产品应用8

DeepSeek-V3.2-Exp:用稀疏注意力打破长文本效率瓶颈

在NLP领域,处理长文本时传统注意力机制效率低。DeepSeek团队推出DeepSeek-V3.2-Exp模型,引入稀疏注意力机制,在保持性能同时提高长文本处理效率,降低计算复杂度,在多基准测试中表现良好。

CourseAI
产品应用8

5小时通关《原神》主线!Lumine:AI玩家正式登场

Lumine能像人类一样理解游戏画面、推理并操作,以接近人类效率5小时通关《原神》蒙德主线,还能零训练玩《鸣潮》等。它是开放式研发方案,靠少量数据和显卡让模型成强大智能体。

带你学AI
新闻资讯7

OpenAI推出GPT-5.1小小小小更新!!!

OpenAI推出GPT-5.1,本周向用户陆续推送,付费用户先行。它有两大核心模型,在遵循指令、推理回复及聊天体验上更佳。还有AMA问答活动披露更多细节,此外官方让自定义ChatGPT风格更易。

AI寒武纪
开源动态8

自回归科学基座模型 BigBang-Proton,提出实现 AGI 的新路线

超对称公司发布自回归科学基座模型 BigBang - Proton,挑战主流 AGI 技术路线。它实现多学科问题与 LLM 统一预训练和推理,有三项创新,在多专业任务表现出色,还提出宇宙尺度压缩构想。

AI科技大本营