「推理能力提升」共找到 6137 篇相关文章
腾讯混元数字人团队发布Moral RolePlay基准,揭秘大模型的「道德困境」
腾讯混元数字人团队和中山大学推出「Moral RolePlay」测评基准,评估大模型扮演多元道德角色能力,揭示顶尖AI模型演不好反派,暴露模型理解社会心理复杂性的局限,还给出未来对齐技术方向。
打破「数据暴力」预训练惯性,阿里Qwen、上交大等提出预训练动态数据选择范式OPUS
阿里Qwen、上交大等团队提出预训练动态数据选择范式OPUS,打破“数据暴力”预训练惯性。它将数据选择与优化器更新轨迹对齐,提升预训练效率与下游泛化表现,实验显示其“效率+性能”双提升。
openJiuwen社区首发Team Skills,定义Coordination Engineering新范式
文章围绕多智能体系统协作问题,指出传统任务编排方式的局限。华为JiuwenClaw团队发布Coordination Engineering新范式,通过Agent Team、Team Skills等能力,解决团队组建、技能沉淀、复用及进化等问题,并以旅行规划为例展示实战效果。
全球第一! 中国模型登顶榜首,首个可编辑AI语音来了
中国AI语音ViiTorVoice登顶全球语音权威评测榜单Seed - TTS,首创「局部编辑」能力,解决语音无法局部编辑痛点。实测效果惊艳,还具备精准情绪控制、无参考文本克隆等能力,部分模型已开源。
8岁小孩哥「聊出」操作系统,一部手机、几句话,原生App直接生成
8岁小孩扑满借助秒哒做出「操作系统」雏形,百度2026 Create大会上秒哒3.0迎重要升级,从移动端、原生App、企业版、Agent能力四个维度重构,降低开发门槛,提升能力至生产级。
灵码+Qwen3-Coder——使用Skill机制实现代码审核
本文探讨在灵码内使用Claude Skills能力,介绍其实现机制、灵码适配方案。还以代码审核场景为例,展示自定义Skill的创建方法,总结Claude Skills优势及应用场景,展望其与MCP的发展前景。
顶尖AI竟输给三岁宝宝,BabyVision测试暴露多模态模型硬伤
UniPat AI 等发布多模态理解评测集 BabyVision,测试显示多模态大模型纯视觉能力仅达三岁幼儿水平。其通过对比实验、细分任务评测,揭示模型系统性缺基础视觉能力,还给出新方向及发展建议。
Hybrid Model Support:阿里云 Tair 联合 SGLang对 Mamba-Transformer 等混合架构模型的支持方案
文章介绍阿里云 Tair KVCache 团队与SGLang社区在推理框架上支持混合架构模型的工程化实践。分析混合架构崛起原因、面临挑战,阐述内存管理、关键技术优化方案,验证性能,并指出未来演进方向。
太卷了!专属Coding的新一代Arena榜单来了,有国产模型登上榜首
大模型编程竞争激烈,编码能力提升成军备竞赛。LMArena发布新世代大模型编码评估系统Code Arena,国产模型智谱GLM - 4.6登上榜首,其编码能力获认可,彰显国产大模型硬核实力。
翁荔陈丹琦加盟的840亿AI公司,公开第二篇论文
明星创业公司Thinking Machines公开第二篇研究论文,主题为“Modular Manifolds”,通过统一框架约束和优化网络不同层/模块,提升训练稳定性与效率。论文提出模块化流形思路,若应用于大模型,训练效率和稳定性将大幅提升。