「数学推理测试」共找到 3543 篇相关文章
Claude 4发布:最强AI编程模型+最强AI Agent基建!
Google I/O大会后一天,Anthropic凌晨发布Claude Sonnet 4和Claude Opus 4。Claude Opus 4是“世界上最好的编程模型”,Claude Sonnet 4适合日常编程。此次更新有四大核心改进,聚焦开发者。还介绍了工作模式、定价等。
一分钟做3D音符版“跳一跳”,Flowith成通用Agent新“必玩王者”丨TIP 003
Flowith作为较早出海的AI产品,以自由画布+通用Agent组合出圈。其Neo版本技术功能强,产品服务有亮点,如不限DeepResearch任务、以人为主的智能代理、回答速度快等,虽有不足但未来值得关注。
DiffMoE:动态Token选择助力扩散模型性能飞跃,快手&清华团队打造视觉生成新标杆!
清华大学和快手可灵团队推出DiffMoE,通过创新的动态token选择机制和全局token池设计,拓展了扩散模型的效率与性能边界。实验表明,DiffMoE在多方面超越现有模型,未来集成先进技术或有新增益。
支持中文!NotebookLM自动生成播客
Google宣布NotebookLM语言摘要功能支持50多种语言,包括中文,可将上传文档转成播客对话形式。以一篇AI进化论文为例展示效果,其音频和内容质量不错,学习输入立体,还能助力AI播客创作。
实战指南:从零构建 MCP 架构下的 Agentic RAG 系统,无第三方MCP Server
五一期间作者用MCP架构从零实现Agentic RAG系统,分享MCP与Agentic RAG融合思考、架构设计,介绍MCP服务端和客户端实现,还做了端到端效果演示,指出架构优势及待优化处。
万字详解GPT-6 Astra,Sebastian Raschka带你读懂循环Transformer与隐藏的思维链
著名技术博主Sebastian Raschka针对GPT-6 Astra的循环Transformer设计与隐藏思维链争议,万字详解技术细节,分享Astra实测表现,梳理循环Transformer技术演进,澄清相关误解。
GPT-5.6仅用一天改写数学史,「双菲」五人团队8年纪录被破!
GPT-5.6一天打破陶哲轩五人团队8年大素数空隙纪录,提出「倾斜剩余类」构造法,当天通过Lean语言机器验证。此前数学家张益唐、陶哲轩等在素数分布问题上各有探索。
鹅厂员工都是怎么被AI“糊弄”的?
文章邀请鹅厂同事分享被AI“糊弄”的离谱事件,如AI在发票报销、数学计算、编程问题等方面出错,还会编造不存在的信息,其“系统性可信”假象比单纯答错更危险。
刚刚,清华黄高、北大刘譞哲等入选2026科学探索奖
2026年「科学探索奖」获奖名单揭晓,50位青年科学家入选,覆盖10个领域。其中信息电子领域5人,包括清华黄高、北大刘譞哲等,他们研究方向多元,成果显著,对AI发展意义重大。
Anthropic滑跪认错!Claude暗中降智实锤
开发者argofowl排查后发现Claude Code将「high」推理程度读成原本「low」对应的值,原来Anthropic在做实验。科技博主曝光后AI圈炸锅,工程师虽回应,但Opus 5也被指降智。