「自进化能力」共找到 4401 篇相关文章
马斯克转发字节Seed&哥大商学院新基准:大模型搞金融,连查个股价都能出错
字节跳动Seed团队与哥大商学院推出开源金融搜索与推理基准测试FinSearchComp,含635个问题。评测显示大模型处理金融任务有差距,凸显金融AI能力评估重要性,还揭示了关键能力差距。
大模型解数学题是真懂还是 “死记硬背”?|首个反例驱动的数学推理基准揭穿 “刷题式假象”!
随着大语言模型在数学领域应用渐广,其是否真具备数学推理能力成焦点。清华等团队提出反例推理评测基准COUNTERMATH,测试20+主流模型,结果不佳,而小样本微调能显著提升模型能力。
谷歌超强 AI Agent 登场:攻克 300 年数学难题、改进芯片设计!编程迎来 AlphaGo 时刻?
谷歌 DeepMind 推出由 Gemini 驱动的 AI 智能体 AlphaEvolve,能自我进化解题。它破数学界 53 年纪录,解决 50 多个数学难题,还应用于谷歌数据中心、芯片设计等,提升效率。其进化方法独特,还能减少幻觉。
Agent规模化落地前夜,AI Infra的难题全都暴露了
随着AI Agent大规模落地,中国云服务市场结构转变,AI基础设施角色改变。InfoQ联合腾讯云发起「InfraTalk」直播,探讨AI Infra能力框架等。还解析其核心能力、难题、价值闭环标准及未来竞争焦点。
腾讯混元数字人团队发布Moral RolePlay基准,揭秘大模型的「道德困境」
腾讯混元数字人团队和中山大学推出「Moral RolePlay」测评基准,评估大模型扮演多元道德角色能力,揭示顶尖AI模型演不好反派,暴露模型理解社会心理复杂性的局限,还给出未来对齐技术方向。
清华上交满分论文证明:强化学习并不能让大模型更会思考!
清华和上交在NeurIPS 2025的研究《Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?》获满分。研究聚焦RLVR,发现强化学习不能让大模型更会思考,推理能力上限仍由基础模型决定。
GPT-5.4发布:OpenAI首个大一统模型,简直是龙虾原生
OpenAI发布GPT - 5.4,这是其首个大一统模型,将推理、编程等能力融合,且单项性能领先。它在知识工作、计算机使用、编程调试等能力提升,定位AI数字员工,虽单价高但有省钱机制。
ICML 2025|多模态理解与生成最新进展:港科联合SnapResearch发布ThinkDiff,为扩散模型装上大脑
现有扩散模型缺乏多模态推理创作能力,在算力和数据不充裕时实现该功能是难题。ICML2025上,港科联合SnapResearch提出ThinkDiff,以较少资源让扩散模型有思考能力,开辟多模态理解生成新路径。
全球第一! 中国模型登顶榜首,首个可编辑AI语音来了
中国AI语音ViiTorVoice登顶全球语音权威评测榜单Seed - TTS,首创「局部编辑」能力,解决语音无法局部编辑痛点。实测效果惊艳,还具备精准情绪控制、无参考文本克隆等能力,部分模型已开源。
装完Hermes Agent玩了一圈,我觉得龙虾已死!
Hermes Agent势头正猛,被视为龙虾以来首个真正的竞争对手。它让Agent自己做Harness Engineering,自己写、用、改Skill,还能自我迭代。文章介绍了安装使用方法,对比了与其他项目的差异。