「数学超级智能」共找到 3864 篇相关文章
The Batch: 859 | Qwen3 的自主智能新进展
不到两周前 Kimi K2 超越其他开源非推理模型,如今阿里巴巴发布基于早期 Qwen3 - 235B - A22B 的三款新大语言模型权重,介绍了输入输出规格、架构设计、性能表现、使用方式等,还进行了性能对比。
大模型IMO25数学竞赛成绩公布了
大模型挑战IMO 2025成绩出炉,Gemini 2.5 Pro以超30%总成绩断崖式领先,超出第二名89%。测试由MathArena组织,采用统一环境和双人匿名评估。还介绍了测试模型、题目及模型表现,人类版结果预计本周六发布。
Harness is the New Dataset:模型智能提升的下一个关键方向
文章指出当基模能力成熟,决定 agent 上限的是围绕模型搭建的系统,即 harness engineering。介绍其组件、设计原则,探讨模型与 harness 关系,还列举创业机会项目,最后推测下一范式是 Coordination Engineering。
2026企业级智能体白皮书|甲子光年智库
随着大模型发展,人工智能从Chatbot转向Agent形态,OpenClaw等开源框架在消费级市场出色,但企业级应用需安全性、稳定性与管控边界。九科信息bit - Agent是企业AI进化“元枢纽”,白皮书为企业决策提供参考。
88岁图灵奖得主,用Claude一小时破解30年数学悬案
88岁图灵奖得主高德纳发文称,他研究数周、可追溯到30年前的三维图论开放问题,被Claude Opus 4.6仅用1小时、31次探索就破解,还给出通用构造算法,这让向来对生成式AI保留的他致敬Claude。
智能体崛起,AI+软件研发到新拐点了?
InfoQ《极客有约》X AICon 直播邀请多位嘉宾探讨 LLM 时代软件研发新范式。指出 AI 在测试中多为提效工具,距“原生开发时代”尚远;Coding Agent 潜力大;还谈及 AI 应用场景、落地问题、人员能力要求等。
从 CIPS & CLM 迈进:中国大模型的智能跃迁
中国中文信息学会2025学术年会暨第二届中国大模型大会(CIPS & CLM 2025)于10月28日在北京召开,众多专家学者参会。大会聚焦大模型多方面内容,发布“大模型基金”,举办多场报告与论坛,展现中国AI领域进展。
从「知题」到「知人」:UserRL让智能体学会「以人为本」
大语言模型距成真正用户伙伴缺‘知人’能力。来自UIUC与Salesforce团队提出UserBench和UserRL方案。前者将‘用户特性’制度化,构建评测环境;后者搭建统一强化学习框架,探索奖励建模,二者让‘以用户为中心’落地。
本周推荐的5个超级6的Github开源项目!
文章推荐了5个Github开源项目。如htmx,能在纯HTML搞定多种交互,无需JS;Flow.Launcher可快速搜索文件、启动应用;Maple Mono是编程字体,中英2:1对齐;Trilium Notes是分层笔记神器;Hyprnote可实时转录会议内容。
本周推荐的5个超级6的Github开源项目!
文章推荐了5个超棒的Github开源项目。有轻量全能、自带阅后即焚的pastebin工具microbin;容器与K8s管理利器Podman Desktop;开源投屏神器Escrcpy;强大易用的国产建站工具Halo;跨平台AI笔记神器NoteGen。