多跳问题」共找到 408 篇相关文章

新闻资讯7

GPT-5编程测评大反转!表面不及格,实际63.1%的任务没交卷,全算上成绩比Claude高一倍

Scale AI的新软件工程基准SWE - BENCH PRO测试中,‘御三家’表面解决率低。深入看,GPT - 5已提交任务准确率比Claude高一倍。该基准新多、更复杂,能真实考验模型能力,当前模型解决商业能力有限。

量子位
新闻资讯7

Hinton万万没想到,前女友用ChatGPT跟他闹分手

Hinton在接受采访时爆料前女友用ChatGPT和他分手。访谈中他分享AI观点,认为人类应让AI成母亲,还谈到用ChatGPT研究、修理等,也纠正从谷歌离职原因。

量子位
新闻资讯7

ChatGPT正测试神秘功能

ChatGPT正测试名为“Study Together”的新功能,已出现在部分订阅用户工具列表。它或更多提让用户回答,似回应谷歌LearnLM,还可能支持多人学习小组模式,有望减少其被滥用可能。

AIGC开放社区
推荐文章7

大语言模型高考数学拿高分靠强化学习,那文科考高分得靠什么?

大语言模型在高考数学拿高分靠强化学习,但文科无标准答案,此方法行不通。豆包1.6系列高考文科全科获683分,靠训练数据、思维链、长上下文和多模态直接读图等因素。

宝玉AI
推荐文章8

从0开发大模型的17种Agent架构演进详细拆解

文章详细拆解从0开发大模型的17种Agent架构演进,介绍各架构解决的、状态、拓扑、路由、失败模式等,指出Agent架构本质是控制流设计,还给出架构选择建议及判断新架构的方法。

腾讯技术工程
新闻资讯8

林俊旸从阿里离开后首度发声:推理模型的时代快结束了

前通义千Qwen负责人林俊旸离职后发长文,指出AI正从「推理思考」转向「智能体思考」,分析推理模型发展,谈混合思考模式失败,还提及智能体思考挑战及相关企业、学术界进展。

花叔
新闻资讯7

Qwen 团队动荡:三个核心成员同时离职

2026年3月3日半夜,通义千(Qwen)团队核心技术负责人林俊旸公开告别,至少两位核心贡献者也相继离场。猜测离职或因阿里云架构调整、DAU考核压力。此变动对开源生态中期影响大。

宝玉AI
算法论文7

告别RAG相似匹配!百度Agentic-R为多轮搜索重塑检索器

传统检索增强生成(RAG)有“单跳”局限,多跳推理易出错。人大高瓴与百度提出面向智能搜索的检索器训练框架 Agentic - R,采用双视角打分和双向飞轮模式,在多数据集上表现出色。

PaperAgent
开源动态8

顶尖AI竟输给三岁宝宝,BabyVision测试暴露多模态模型硬伤

UniPat AI 等发布多模态理解评测集 BabyVision,测试显示多模态大模型纯视觉能力仅达三岁幼儿水平。其通过对比实验、细分任务评测,揭示模型系统性缺基础视觉能力,还给出新方向及发展建议。

AINLPer
新闻资讯8

国足缺席世界杯,但中国大模型们集体参赛

联想在2025联想天禧AI生态伙伴大会宣布举办AlphaGoal预测杯,8家中国大模型将与普通球迷、开发者的AI Agent同台,预测世界杯赛果。这或触发足球体验革命,推动AI走向真实世界。

量子位