「长期推理能力」共找到 4718 篇相关文章
腾讯 Hy3 一手实测,Agent 能力提升不止一点
作者拿到 Hy3 模型测试资格,介绍其架构、性能和价格优势,还在 WorkBuddy 里实测它完成运营工作、选编辑助教、开发新功能等任务的效果,最后评价 Hy3 能力、价格、适配方面的表现,并分析 WorkBuddy 领先原因。
为什么资深开发者讲不清自己的专业能力
文章探讨资深开发者讲不清专业能力的原因。指出公司存在业务团队消除不确定性和开发者管理复杂性两个循环,开发者因用自身逻辑沟通而失败,还给出沟通口诀,最后提到AI虽能快速写代码,但开发者仍需承担责任。
AI Spot 学术分享会丨ICLR 2026 深度推理专场
当大模型走向深度推理,ICLR 2026 汇聚全球顶尖成果。OpenMMLab 等联合发起 AI Spot ICLR 2026 学术分享会,5 月 14 日 19 点直播,聚焦模型‘慢思考’,嘉宾将解读四大核心技术。
大突破!实验证明,RL能为LLM注入“创新”能力
此研究挑战‘RL不教新技能’观点,通过‘字符串转换预测’实验证明,RL能让LLM学会组合已有原子技能,形成可泛化、迁移的元技能,还给出模型能力提升路径。
微软预览 Foundry Agent Service 长期记忆功能,简化状态管理
在年度 Ignite 大会上,微软宣布公开预览 Foundry Agent Service 中的记忆功能,这是全托管长期记忆存储,与代理服务原生集成。开发者可存储、检索和管理关键上下文,系统自动处理复杂“管道”。
美国模型长期霸榜的LMArena,出现了一个国产模型
2025 年底,中美 AI 阵营发展路径有区分,美国多是强模型加工具链,中国在多方面发力。12 月 23 日 LMArena 更新文本榜,百度文心新模型 ERNIE - 5.0 - Preview - 1203 以 1451 分登上榜单,成中国第一且是前 20 名里唯一非美国模型。
LLM算力告急?把文本变图片,推理成本直接减半!
大型语言模型处理长文本时计算成本高,本论文探索‘文本即图像’输入压缩策略,将长文本渲染为图像输入多模态模型,可减少近一半令牌,且任务性能不受显著影响,在多任务中验证了其有效性。
阿里又上好货了!Qwen3-TTS能力大幅提升
阿里刚发布Qwen3-TTS(2025-11-27版),解决语音合成核心问题。它音色大幅扩展,有49种高品质音色;语言和方言能力提升,支持10种主流语言与多种方言;韵律和语速优化,拟人化近真人;API调用简单。
AI 时代的洞察方法论:结构化思维与能力迁移
文章以高盛数字化架构设计为例,探讨AI时代技术分析的能力迁移。指出AI使信息采集整合成本降低,技术分析重心从找信息转向构建模型,建模仍是洞察主战场,AI可加速知识铺垫,但模型切换需人类完成。
微软深夜发布SambaY架构,Phi-4min加速10倍推理
微软基于Phi - 4 - mini微调出Phi - 4 - mini - Flash - Reasoning 3B模型,扩展到200064 tokens。采用新型SambaY架构,支持64K token上下文长度,运行速度比前代快10倍,有诸多优点。