推理严谨性」共找到 2484 篇相关文章

新闻资讯7

Claude 小升级就赢了OpenAI 9年“开源神作”?高强度推理直接歇菜、幻觉率高达50%,写作还被Kimi 2吊锤?

OpenAI发布首个开源语言模型系列gpt - oss,包括gpt - oss - 120b和gpt - oss - 20b,可在Hugging Face下载。同期谷歌Deepmind推Genie 3,Anthropic放出Claude Opus 4.1。Claude Opus 4.1编程能提升,实测编码能力强于gpt - oss。gpt - oss虽有亮点,但幻觉率高、实测效果不佳。

AI前线
开源动态7

Claude 小升级就赢了OpenAI 9年“开源神作”?高强度推理直接歇菜、幻觉率高达50%,写作还被Kimi 2吊锤?

OpenAI发布首个开源语言模型系列gpt - oss,包括gpt - oss - 120b和gpt - oss - 20b,可在Hugging Face下载。同期谷歌、Anthropic也有新模型推出。gpt - oss有亮点,但也存在幻觉率高、实测效果差等问题。

InfoQ
算法论文8

10秒视频token超5万,O(n²)跑不动?用后训练线化框架实现1.71倍加速,推理成本大降|CVPR'2026

视频生成进入大规模时代,但计算成本高,自注意力复杂度O(n²)跑不动。研究团队提出LINVIDEO后训练框架,无需数据和重新预训练,实现视频扩散模型线化替换,保持生成质量,加速推理并降低成本。

量子位
算法论文8

7篇顶会NeurIPS 2025最佳论文都说了什么?

NeurIPS 2025七篇获奖论文揭示大模型思维同质化、推理能力虚幻边界等隐忧,也在注意力机制、神经扩展定律等方面取得物理学层面突破,为AI建立更严谨科学地基。

AIGC开放社区
8

华师大智金院孵化金融原生基模Mint-Agent:超越GPT-5.6与Claude Opus 4.8,商业订单已超亿元

华东师大智金院团队孵化的金融原生基模 Mint - Agent 发布,在 FinanceAgentBench v2 上表现超 GPT - 5.6 - Sol 与 Claude Opus 4.8,单题推理成本低,商业订单超亿元,进入规模化金融场景验证阶段。

机器之心
算法论文8

DeepSeek开源大模型记忆模块!梁文锋署名新论文,下一代稀疏模型提前剧透

DeepSeek最新论文给Transformer加上“条件记忆”,补上原生知识查找机制。梁文锋署名,与北大团队合作。提出全新范式及Engram模块,解决传统N - gram问题,研究稀疏分配,验证推理能力提升,兼顾工程优化。

量子位
算法论文8

横扫八大数学竞赛:清华微软联合提出STAR-PólyaMath,Apex基准超GPT-5.5 13.5%

清华大学与微软亚洲研究院团队提出推理多智能体系统 STAR - PólyaMath,构建探索 - 推理 - 验证框架,解决大模型长程数学推理瓶颈,在八大数学竞赛基准获最优成绩,还可泛化到其他推理场景。

机器之心
算法论文8

让大模型学会「心灵感应」:基于思维沟通的多智能体合作范式来了

NeurIPS 2025的论文提出思维沟通概念,建立潜在思维可识别理论,构建ThoughtComm框架。该框架让模型共享潜在思维,跳过语言冗余歧义,实验显示其提升了协作效率与推理能力,或开启新智能形态。

机器之心
算法论文8

编程智能体的隐藏bug,被上交IPADS团队用数学逻辑给揪出来了

上海交通大学 IPADS 研究团队打造 FM - Agent,实现大规模系统全自动正确推理。它能从顶尖编程智能体生成的大规模系统中找出隐藏 bug,还提出新规约生成方法,在绝对严谨与工程可用间找到平衡。

DeepTech深科技
产品应用8

面壁MiniCPM-SALA模型,稀疏-线注意力,单卡吞吐百万上下文

面壁智能团队提出SALA,基于此训练的MiniCPM-SALA模型,在单张A6000显卡实现百万token超长上下文推理,训练成本降约75%。它结合稀疏与线注意力,采用混合架构,继承权重降低成本,在长文本处理上优势明显。

AIGC开放社区