中文思考」共找到 766 篇相关文章

开源动态7

国内首套:港中文团队发布7模态人体动作数据集,揭开大模型理解能力短板

中文邢国良教授团队博士生蒋思阳完成 CUHK-X 多模态人体动作数据集,成果被 ACM MobiSys 2026 接收。用其测试主流大模型,发现理解人类动作平均正确率仅四成。该数据集数据收集方法反常规,还开展了基准测试。

DeepTech深科技
算法论文8

面对无解问题大模型竟会崩溃?港中文&华为联合提出首个大模型推理可靠性评估基准

中文和华为诺亚实验室联合提出ReliableMath基准,探究大模型推理可靠性。提出评估准则,构建含可解与不可解问题的ReliableMath数据集,实验揭示大模型缺陷,还提出提高可靠性的对齐策略。

机器之心
开源动态8

蚂蚁开源万亿参数思考模型 Ring-1T,综合能力逼近 GPT-5、数学能力对标 IMO 银牌

10月14日凌晨,蚂蚁集团推出万亿参数思考模型Ring-1T并全面开源。它在多任务榜单表现均衡,数学能力达IMO银牌水平,通用能力逼近GPT - 5,还采用自研算法应对行业难题,目前可下载体验。

AI前线
算法论文8

5秒完成3D场景编辑,北大&港中文&上海AI Lab搞出VGGT-Edit,120倍加速太炸了

北大、港中文等团队提出原生3D编辑框架VGGT-Edit,不再绕回2D,直接在3D空间编辑。它采用残差场预测等机制,在DeltaScene测试集表现出色,单次编辑约5秒,最高120倍加速。

量子位
新闻资讯7

Claude Code越更越废?!大厂AI主管公开怒喷思考深度暴跌,官方回应更被怼爆 :菜成AI“玩具”

Claude Code在2月更新后无法用于复杂工程任务,AMD AI团队主管Stella Laurenzo分析发现其思考深度下降67%、算力消耗增加。开发者不满,Claude Code负责人回应未获认同,部分开发者考虑转用Codex。

InfoQ
新闻资讯7

Claude Code越更越废?!大厂AI主管公开怒喷思考深度暴跌,官方回应更被怼爆 :菜成AI“玩具”

开发者 Stella Laurenzo 分析称,Claude Code 在 2 月更新后,思考深度下降 67%、算力消耗大增,无法用于复杂工程任务。她提出改进建议,开发者对此认同,负责人回应遭反驳,部分人考虑转用 Codex。

AI前线
算法论文8

腾讯混元 x MBZUAI 港中文新研究:将纠错纳入策略空间,Search-R2 重构搜索增强推理学习方式

过去大语言模型能力提升靠参数和数据扩张,但在真实任务中此路径有局限。腾讯混元、MBZUAI、港中文联合团队提出Search - R2,将纠错纳入策略空间,抑制错误传播,在多跳推理任务中优势显著。

AI科技评论
算法论文8

ICLR 2026 Oral|大模型总爱「想太多」? DECS从源头消除冗余思考,实现推理token减半且性能不降反升

以DeepSeek - R1等为代表的大型推理模型存在过度思考问题,造成大量冗余计算。复旦大学等团队在ICLR 2026 Oral论文中揭示‘长度惩罚’局限性,提出DECS框架,在多基准测试中实现推理长度减半且性能提升。

机器之心
新闻资讯8

林俊旸从阿里离开后首度发声:推理模型的时代快结束了

前通义千问Qwen负责人林俊旸离职后发长文,指出AI正从「推理思考」转向「智能体思考」,分析推理模型发展,谈混合思考模式失败,还提及智能体思考挑战及相关企业、学术界进展。

花叔
新闻资讯8

地平线余凯:80%的精力思考死门在哪

2025年4月18日,地平线举行发布会,创始人余凯分享战略思考方法论与“反共识”思考。他认为公司应在无竞争处竞争、不冒险,智能驾驶重功能价值,AI时代产品逻辑有别互联网,还提及技术变革战略、“平权陷阱”及高阶智驾基础。

芯师爷