复杂推理能力」共找到 5074 篇相关文章

算法论文8

景不动人动,MLLM如何面对「移步换景」的真实世界?OST-Bench揭示多模态大模型在线时空理解短板

上海多所高校研究者提出 OST - Bench,从智能体探索场景动态在线视角挑战大模型能力。它更贴近真实世界,揭示主流多模态大模型在线时空理解短板,为未来模型发展指明方向。

机器之心
算法论文8

DeepSeek-V4蓄势待发!梁文锋署名论文或开启第二个DeepSeek时刻

据报道,DeepSeek将于2月发布新一代旗舰模型DeepSeek V4,其编程能力或超Claude和GPT系列。最新论文提出Engram条件记忆机制,分离死记硬背与逻辑推理,揭示新稀疏性分配定律。

AIGC开放社区
算法论文8

RL是「点金石」还是「挖掘机」?CMU 用可控实验给出答案

卡耐基梅隆大学研究者构建基于GSM - Infinite的可控合成数据框架,分析预训练、中期训练和RL对模型推理泛化能力的影响,调和了RL有效性的不同观点,为改进训练策略提供基础。

机器之心
产品应用8

深夜炸场!Claude Sonnet 4.5上线,自主编程30小时,网友实测:一次调用重构代码库,新增3000行代码却运行失败

Anthropic推出Claude Sonnet 4.5,号称‘世界上最好的编码模型’,持续运行时长、推理能力提升,‘幻觉’等问题改进,Claude Code也有更新,开发者实测有惊喜也有问题,新一轮AI‘内卷’开启。

AI科技大本营
产品应用7

Jina 第4版:多模态向量检索,统一适配,挑战3大任务

Jina第4版基于Qwen2.5 - VL模型扩展,支持单向量和多向量输出。它经对比学习和任务特化训练,推理时可按需选LoRA适配器,能利用多模态处理能力优化不同任务性能。

CourseAI
新闻资讯8

The Batch:835 | 图表中的 AI 市场趋势

知名投资分析师 Mary Meeker 时隔六年发布 340 页 AI 市场报告。报告指出 AI 变革快、性能攀升、有新兴能力,还会影响劳动力等,同时也带来经济不确定性,当下是开发软件应用的黄金时期。

DeeplearningAI
新闻资讯7

codex负责人:codex就要过时了

Codex负责人称两三个月后Codex将过时,因下一代模型要处理大规模并发Agent,非其能应对。Huggingface实验显示大小模型在不同harness下排名差异大,脱离模型谈harness过时或不适配说模型Agent能力都不妥。

探索AGI
开源动态8

智谱 GLM-4.7,Coding 开源第一,其他也很强

智谱正式发布并开源专为 Agentic Coding 打造的 GLM-4.7 模型,编程、推理、Agent 能力成绩亮眼,价格比 Claude Sonnet 4.5 更优。还推出 Coding Plan 套餐,使用方式多样。发布前几天,智谱港股招股书挂网。

AGI Hunt
开源动态8

一张4090就能爆改!面壁智能MiniCPM-V 4.6开源,1B多模态卷出新高度

今年是AI应用大规模落地年,参数小的端侧模型有特定场景性能优势。5月11日面壁智能开源MiniCPM-V 4.6,参数仅约1B,多模态能力超阿里、谷歌同类模型,还在多维度提升,站稳端侧多模态开源领域。

机器之心
算法论文8

美团LongCat扎扎实实做了件难事:LLM数学新天花板AMO-Bench

美团LongCat团队联合高校推出AMO - Bench,用50道原创奥赛级难题评估LLM数学能力。它解决现有基准测试痛点,经四重把关构建,测试显示顶级模型表现不佳,也揭示模型提升空间大。

PaperAgent