「Token优化」共找到 1823 篇相关文章
LeCun有了新证据!大模型思考与人类思考存在本质差别
Yann LeCun参与的研究用信息论揭示大语言模型与人类在‘理解世界’上的本质差异。研究引入新量化框架,分析主流大模型,发现AI与人类在‘理解’上有三大核心差异,对当前AI发展趋势提出挑战。
一周两破18年数学纪录!陶哲轩惊叹:AlphaEvolve带来久违「加速度」
人类数学家与AlphaEvolve携手,一周内两次刷新18年未破的数学纪录。先是AlphaEvolve将和差集的θ下界提升,后人类数学家Gerbicz在其基础上再进一步,展现AI与人类协作在数学研究中的惊人潜力。
微软 CEO吹爆「智能体」:AI不仅要“杀死”SaaS,操作系统也会“格式化”重来
微软CEO萨蒂亚·纳德拉在Build 2025大会后深度访谈,回应‘SaaS已死’论,抛出‘零成本智能’和‘无代码操作系统’愿景,还阐述了AI智能体、SaaS变革等观点,强调微软全面押注AI。
阶跃Step 5 Preview没赢GPT,但反而更好用了
本文作者实测600B参数量的阶跃Step 5 Preview大模型,从写码、幻觉控制、写作三个维度,对比GPT及其他国产头部模型,分享无滤镜真实体验,给出选型参考。
DoorDash 如何打造了一款不完全依赖大型语言模型(LLM)的 AI 购物助手
DoorDash 分享对话式 AI 助手 Ask DoorDash 的架构,它借助 LLM、AI 代理等构建系统。测试显示其提升了结账转化率等指标,还构建自动评估框架改进质量衡量,架构分离协调与业务功能。
360 周鸿祎:做中国版 Mythos 不能照搬美国路线,基模能力的差距可以通过Harness补齐
过去几月,Anthropic的Mythos模型成全球网络安全焦点。360周鸿祎在ISC.AI 2026上发布‘图龙锋’和‘仪天阵’,欲做中国版Mythos,还发起‘磐石之盾’计划。他认为不能照搬美国路线,可通过Harness弥补基模差距。
微软 SkillOpt:不动模型权重,只训练那份「技能说明书」
微软研究院 Yifan Yang 等人推出 SkillOpt,思路反直觉,不动模型权重,把「技能文档」当可训练参数。它在 52 个组合中表现最优,技能可迁移,代码已开源,还支持多操作。
前 DeepMind 研究员反思:评测,而非算力或数据,才是下一阶段的瓶颈
前 Google DeepMind 高级研究员 Lun Wang 在技术长文中指出,当前主流评测体系滞后,静态基准会“安静失效”。作者主张引入序参量,呼吁构建自演进评测,还为一线工程师提供了研发建议。
ICSE 2026杰出论文 | 突破代码模型真实工程落地瓶颈,北大团队提出SEAlign对齐框架:显著提升软件工程智能体决策质量
现有代码模型在经典基准表现好,但在真实软件工程环境表现差。北大金芝、李戈团队提出 SEAlign 框架,通过识别与对齐智能体轨迹关键决策点,提升模型在真实工程任务表现,成果获 ICSE 2026 杰出论文奖。
当 Claude 开始自己做增长,Anthropic 真正关心的是什么?
Anthropic面临模型迭代外的挑战,增长负责人Amol Avasare在访谈中披露公司战略。如应对‘Success Disasters’、降低产品使用门槛、优化引导流程等,还提及增长职能演进。