通用推理能力」共找到 5065 篇相关文章

开源动态8

全网惊了!陶哲轩带AI下场,33分钟「盲证」数学

菲尔兹奖得主陶哲轩携手ChatGPT打造开源数学概念验证工具,数天迭代至2.0版,可全自动或半自动证明。还支持渐近估计,上手简单、可扩展性强。此外,他用AI 33分钟“盲做”一页数学证明,重塑研究范式。

新智元
推荐文章8

深度解读:关于 Jev 的几大疑问

本文针对全网爆火的AI模型Jev,梳理业界不同观点,解读其技术路线、核心特性、能力边界与适用场景,解答大众对Jev的核心疑问,客观分析其真实价值。

AI科技评论
推荐文章8

阶跃Step 5 Preview没赢GPT,但反而更好用了

本文作者实测600B参数量的阶跃Step 5 Preview大模型,从写码、幻觉控制、写作三个维度,对比GPT及其他国产头部模型,分享无滤镜真实体验,给出选型参考。

探索AGI
新闻资讯8

最全面人类细胞图谱发布:110万个细胞看清调控与衰老

本文是对最新发表的Tabula Sapiens 2.0人类细胞图谱的专业解读,该图谱相比1.0细胞量翻倍至110余万个,覆盖28种组织,解析了细胞调控机制与细胞衰老特征,且完全开放供研究使用。

DeepTech深科技
产品应用8

上海AI实验室发布 Intern Lumina U2:全离散扩散建模,让模型既能“看懂”也能“生成”

上海人工智能实验室发布新一代多模态统一模型 Intern Lumina U2,基于全离散扩散建模路线,支持多任务,适配两大硬件生态,在昇腾千卡级集群训练效率提升 1.85 倍,性能优异且将开放资源。

OpenMMLab
算法论文8

EMNLP 2026高分论文MathDebugger:当合成数据涌入训练集,如何为数学题做体检?

随着合成数据增多,模型需判断数学数据题目能否被信任。北大DCAI团队提出MathDebugger质检BenchMark,覆盖问答两端,评测主流LLM和PRM。还探究能否判断正误、分类错误、修复数据,证明错误标签可作监督信号。

InfoQ
新闻资讯7

马斯克野心升级:再投千亿建地球最大发射场,星舰要一天发30次

当地时间8月25日,SpaceX宣布投资千亿美元在路易斯安那州建巨型太空发射基地,最终成全球最大发射场,具备年支持数千次星舰飞行能力,马斯克称一天能执行超30次飞行。

DeepTech深科技
产品应用7

全球首个跨本体、跨视角、多模态物理世界模型,CurrentWorld-0 来了!

Current Robotics 发布跨本体、多模态物理世界模型 CurrentWorld-0,它从真实数据学规律,整合跨本体、多视角和力触预测,可评测机器人,解决动作可控性等问题,让评测成训练数据入口。

机器之心
开源动态8

2026 GOAI 世界人工智能开源大赛「AI for Research 前沿探索」赛道报名中

2026年7月21日,GOAI世界人工智能开源大赛‘前沿探索(AI for Research)’赛道在杭州启动。该赛道聚焦AI与科研交叉,设算法和开放探索两类赛题,不限学科,重问题定义,认可‘无发现’价值,强调证据链。

深度学习自然语言处理
开源动态7

专访|两位华人主导创办,Jeff Dean参投,伯克利开源项目SkyPilot转型初创

前沿模型团队算力瓶颈从不足变为分散,开源AI算力调度项目SkyPilot应运而生。7月末,它从高校走出成为初创公司,完成2000万美元种子轮融资。其免费版与商业版各有侧重,切入AI编排赛道潜力大。

DeepTech深科技