「通用推理能力」共找到 4990 篇相关文章
大模型是不是到顶了?瓶颈到底在哪
文章探讨大模型是否到顶,指出‘到顶’争论分三个问题,靠堆大模型提升能力之路变平,受数据和成本约束。但大模型还有后训练和推理时计算两个发展方向,未来进步或来自更会用算力。
北大发布学术搜索评测ScholarSearch:难倒一众DeepResearch的“开卷考试”
北京大学DS - Lab发布ScholarSearch,这是评估大语言模型学术检索能力的数据集,含223道高难度题目。评估显示现有模型表现欠佳,纯推理模型准确率低,有搜索功能的模型虽有提升但仍不足。
轻量级易开发,8B参数释放大实力!科学多模态模型Intern-S1-mini开源
上海人工智能实验室继7月26日开源后,推出轻量化版本Intern-S1-mini。它是8B参数“迷你模型”,兼具通用与专业科学能力,适合快速部署和二次开发,在多方面表现出色,还降低了对高端计算设备依赖。
Qwen3.8-27B 登顶全球开源榜第一,曾经的「源神」又回来了!
8月17日,阿里发布的Qwen3.8 - 27B成Hugging Face热门第一。它以27B参数在部分测试中与前沿闭源模型比肩,可本地运行。不过推理慢、真实任务表现待提升,它让前沿Agent能力下放到个人电脑。
开源模型首次物理奥赛IPhO夺金!上海AI Lab 235B模型击败GPT-5和Grok-4
上海AI Lab的P1 - 235B - A22B在国际物理奥林匹克竞赛夺金,在HiPhO基准测试获12金1银,超越GPT - 5等闭源模型。团队构建HiPhO基准测试,用多阶段强化学习训练模型,开发PhysicsMinions系统提升推理能力。
刚刚!Qwen3深夜升级,碾压Kimi K2和DeepSeek V3
通义千问更新旗舰版Qwen3模型,推出Qwen3 - 235B - A22B - Instruct - 2507 - FP8。新模型通用能力显著提升,在多测评中超Kimi - K2等模型,还增强多语言覆盖等性能,已在魔搭和Hugging Face开源。
开放全栈!超越π0,具身智能基础大模型迎来真·开源,开发者狂喜
继π0后,具身智能基座模型WALL - OSS正式开源,多项指标超越π0。它是通用多模态具身模型,具良好推理和泛化能力。背后自变量机器人刚完成近10亿A + 轮融资,开源将降低具身智能门槛。
3B小模型,编程得分比肩Opus 4.5,神秘模型引发热议,原是国产
最近,3B小模型VibeThinker - 3B在X上火了,它在编程等推理任务上比肩前沿大模型,体积却小很多。它是国产模型,来自新浪微博团队,在各项基准测试表现出色,不过在通用知识领域表现欠佳。
中国AI芯片大突围,DeepSeek V3.1引爆算力革命
DeepSeek V3.1发布,是中国AI技术自主性的战略突围。它有6850亿参数,采用UE8M0 FP8适配国产芯片,具混合推理架构、Agent能力等。其发布或重塑AI产业格局,推动国产芯片发展。
Axiom Math 对谈 SGLang:模型的下一步是可验证,结果层才是真正的护城河
在AGI Playground 2026圆桌论坛,Axiom Math联合创始人等探讨AI核心问题。提到AI进入生产环境,可验证或成瓶颈,还从长任务智能体、推理基建等多方面深入交流,如模型验证、基建优化等。