「验证不对称性」共找到 2079 篇相关文章
Agent KB:经验池让Agents互相学习!GAIA新开源SOTA,Pass@1性能最高提升6.66
来自多家机构团队发布 Agent KB 框架,构建经验池实现 AI Agent 经验共享。在 GAIA 基准测试中表现出色,提升多模型 Pass@1 性能,还在软件工程领域展现价值。其设计精妙,经消融、检索策略等实验验证有效。
vivo自研蓝河操作系统内核开源!Rust开发新机遇来了
vivo宣布开源自研蓝河操作系统内核,它由Rust语言编写,解决了传统C语言难题,更轻量化、对硬件要求低且支持多架构。此次开源不仅是国产操作系统突破创新,还将推动Rust生态发展。
「AI重大飞跃」OpenAI官宣:内部实验模型在IMO 2025中取得金牌,GPT-5即将发布
OpenAI研究员Alexander Wei宣布团队开发的内部推理模型在IMO 2025中获相当于人类金牌成绩,还透露GPT - 5即将发布。模型按人类规则评估,解决5个问题,代表AI通用推理能力飞跃,成果不局限于数学推理。
KAG-Thinker:「结构化」思考新范式,支持逻辑严谨的大模型复杂推理
近日,蚂蚁集团知识引擎团队协同高校发布 KAG-Thinker 模型,是 KAG 框架重要迭代。它聚焦复杂推理,建立结构化思考范式,实验显示其性能在多数据集上有提升,还在医疗问答验证了专业领域有效性。
中学生就能看懂:从零开始理解LLM内部原理【十】| “过拟合” 与 Dropout
文章围绕神经网络过拟合问题展开,介绍了过拟合的概念、危害及产生原因,阐述了缓解过拟合的正则化方法,重点介绍了Dropout随机失活,还指出其局限性及在大模型中的应用策略。
从 3 个月业余项目到全球第一语言!Python 之父坦言:当年“将就”的代码,如今全都真香了
Python 之父 Guido van Rossum 在 Python 编程语言峰会上提出‘Worse is better’理论现在是否还适用的问题。回顾早期开发,Python 受 UNIX 精神影响,以‘够用就好’理念快速推出,如今面临新功能开发慢、社区贡献不均等问题。
对谈黄灯:普通二本学生的出路在哪里?
高考季,与《我的二本学生》作者黄灯对谈二本学生出路。指出学历非唯一,能力和热情更重要。当下就业严峻,高校课程与社会需求脱节,二本学生应提升动手能力,利用AI工具,立足学校和当地找机会。
阿里通义开源「推理+搜索」预训练新框架:小模型媲美大模型,多个开放域问答数据集表现显著提升
阿里通义实验室开源通用预训练框架MaskSearch,引入检索增强型掩码预测任务,兼容两种训练方法。实验显示,它在多数据集提升模型性能,小模型能媲美大模型,还验证了训练方式、策略及奖励函数的效果。
小米玄戒O1,五个争议问题与解释
文章围绕小米玄戒O1提出五个争议问题并解释。涉及是否为国产、自研芯片,手机SoC研发难点、小米做SoC原因及玄戒O1是否成功,还结合苹果、高通等案例阐述芯片产业分工等知识。
Qwen团队发布长上下文Reasoning模型QwenLong-L1,超越o3-mini
Qwen团队发布长上下文Reasoning模型QwenLong - L1。当前大模型处理长文本有训练效率低、过程不稳定难题。QwenLong - L1用分阶段强化学习等方法,实验中超越o3 - mini、比肩Claude,还在案例表现出色。