「复杂推理能力」共找到 5117 篇相关文章
Anthropic 官方:Genspark 是如何构建 Agents 的?
Genspark借助Claude打造自适应AI Agents,突破传统搜索工作流限制。其Super Agent以Claude为核心,实现动态协调,变革用户创造和研究方式,带来显著商业影响,揭示AI开发新原则。
代码、多模态检索全面登顶SOTA!智源BGE向量模型三连击,并全面开放
检索增强技术在代码及多模态场景作用大,向量模型是关键。智源研究院联合高校研发三款向量模型BGE - Code - v1、BGE - VL - v1.5、BGE - VL - Screenshot,登顶多领域测试基准,已全面开放助力研究与应用。
900亿天津科技巨头,抓紧押注算力
人工智能产业爆发,算力成竞争核心。中科曙光股价乘风而起,但营收下滑、净利润增速放缓,创始人隐退、控股股东减持带来新考验。不过其全产业链布局或打开新空间,1 - 3月已恢复增长。
OpenAI诈骗?GPT-4.1正式上线ChatGPT,网友实测却大呼失望
OpenAI官宣GPT - 4.1在ChatGPT中可用,Plus、Pro和Team用户可访问。它擅长编码和遵循指令,评估表现有优有劣。实测代码处理表现佳,但网友因无100万上下文窗口API版本而失望。
全网惊了!陶哲轩带AI下场,33分钟「盲证」数学
菲尔兹奖得主陶哲轩携手ChatGPT打造开源数学概念验证工具,数天迭代至2.0版,可全自动或半自动证明。还支持渐近估计,上手简单、可扩展性强。此外,他用AI 33分钟“盲做”一页数学证明,重塑研究范式。
GPT-6 Sol要来了?OpenAI本周或迎「发布狂潮」
本文爆料OpenAI核心人员预告本周将迎来DevDay级别的大规模产品更新,网传GPT-6 Sol已进入灰度测试,OpenAI正推动旧模型迁移,本轮更新覆盖新模型、多模态、智能体等多个领域。
EMNLP 2026高分论文MathDebugger:当合成数据涌入训练集,如何为数学题做体检?
随着合成数据增多,模型需判断数学数据题目能否被信任。北大DCAI团队提出MathDebugger质检BenchMark,覆盖问答两端,评测主流LLM和PRM。还探究能否判断正误、分类错误、修复数据,证明错误标签可作监督信号。
马斯克野心升级:再投千亿建地球最大发射场,星舰要一天发30次
当地时间8月25日,SpaceX宣布投资千亿美元在路易斯安那州建巨型太空发射基地,最终成全球最大发射场,具备年支持数千次星舰飞行能力,马斯克称一天能执行超30次飞行。
全球首个跨本体、跨视角、多模态物理世界模型,CurrentWorld-0 来了!
Current Robotics 发布跨本体、多模态物理世界模型 CurrentWorld-0,它从真实数据学规律,整合跨本体、多视角和力触预测,可评测机器人,解决动作可控性等问题,让评测成训练数据入口。
2026 GOAI 世界人工智能开源大赛「AI for Research 前沿探索」赛道报名中
2026年7月21日,GOAI世界人工智能开源大赛‘前沿探索(AI for Research)’赛道在杭州启动。该赛道聚焦AI与科研交叉,设算法和开放探索两类赛题,不限学科,重问题定义,认可‘无发现’价值,强调证据链。