图论难题」共找到 419 篇相关文章

算法论文7

代码榜刷满分,AI科研却撞墙?140道真实研究撕开「自进化」真相

新工作MLS - Bench覆盖12领域、140个研究任务,评测前沿模型科研能力。虽模型工程执行强,但科学发现能力弱,当前仍难提出有效算法创新。其评测已纳入Kimi K3和Qwen3.8 - Max官方发版表。

新智元
算法论文7

Fable5仅做对3.5%!大模型会看,但还没有主动视觉

本文介绍了专门测量「主动观察」能力的视觉推理基准 ActiveVision,评测显示无外部工具时,大模型与人类准确率有近 9 倍差距,用工具后虽提升但仍远不如人类,还说明了其出与避免取巧的方式。

机器之心
8

金融AI武道大会开赛!四道业务真,出人:猜不到最优解

AFAC2026金融智能创新大赛开赛,赛源于真实金融场景,如识别交易行为、还原金融文档等。它强调回归基础研究,探索模型产业价值,是今年金融AI领域值得关注的比赛。

量子位
新闻资讯8

留给人类数学家的悬赏不多了!谷歌DeepMind一口气解决9道埃尔德什问

AI进军数学界速度惊人,谷歌DeepMind发布由Gemini驱动的AlphaProof Nexus框架,解决9个埃尔德什开放问,还证明44个猜想、搞定代数几何难、改进凸优化理论边界,推理成本低且代码开源。

量子位
开源动态8

OpenClaw大考!上海AI Lab InternLM团队WildClawBench 60,把「龙虾」AI打回原形

上海人工智能实验室InternLM团队推出WildClawBench,含60道高难度任务,在真实OpenClaw环境端到端评测AI Agent。评测涵盖多类别任务,已测14个模型,国产模型表现亮眼,项目开源可复现。

机器之心
新闻资讯7

谷歌Deep Think八语奥赛屠榜!自主攻克4大未解难,科研壁垒崩塌

谷歌Deep Think横扫亚欧多语种竞赛,成绩亮眼。虽评测数据来自内部,未公开细节且是区域赛,但它定位为‘人类智力倍增器’,其驱动的Aletheia已产出论文,解决4个未解问,在多领域展现潜力。

新智元
新闻资讯7

小扎的残酷算术:砸6000亿搞AI,裁1.6万人省钱

路透社爆料Meta计划裁员20%约1.6万人,这或为其自2022年底以来最大规模裁员。与此同时,Meta在AI投入巨大,如6000亿美元建数据中心等,但模型表现不佳,如Llama 4反响平平、Avocado推迟发布。

新智元
算法论文8

谷歌给「AI解数学」神话降温:能摘低垂果实,但过程依然痛苦

谷歌用Gemini对700个Erdős猜想做攻关实验,推进13个问。但他们指出,这并不意味着AI能自动做数学研究,其背后核验等成本远超想象,还需警惕‘潜意识抄袭’。

机器之心
开源动态8

NeurIPS 2025 | 蚂蚁CGM:融合架构重塑代码大模型,探索非 Agent 新范式

在NeurIPS 2025上,蚂蚁将展示Code Graph Model (CGM)。它把代码库结构集成到开源LLM,开启新范式,在代码库级任务上以非Agent方案登顶开放权重模型榜首,解决了复杂软件工程的Agent依赖难

PaperAgent
新闻资讯8

“硬核芯科技园”圆满收官:汇聚中国芯硬核力量,勾勒自主创新全景

2025年9月10 - 12日,SEMI - e深圳国际半导体展举行,“硬核芯科技园”特色展区汇聚10家优秀企业,展示全链条创新成果。底层技术突围,企业展示关键芯片与元件;产业生态共建,保障供应链稳定。

芯师爷