「优化方法」共找到 2556 篇相关文章
从被吐槽“套壳中国大模型”到自研封神!首次揭秘Cursor背后极速代码Agent如何对标GPT5.1 Codex,生成效率提4倍
10月29日,Cursor 2.0发布Composer大模型,效率约为其他模型四倍。开发者分享其成极速代码Agent方法,如强化学习、平衡训练与推理负载等,还提及未来方向及研发反思。
推理时扰动高熵词,增强LLM性能
香港科技大学(广州)研究团队发现LLM推理时,一小部分高熵词显著影响输出正确性。基于此提出MTI方法,含Selective CFG intervention与Lightweight negative - prompt guidance,无需额外训练,能提升模型推理能力。
OpenAI谷歌Anthropic罕见联手发研究!Ilya/Hinton/Bengio带头支持,共推CoT监测方案
OpenAI、谷歌DeepMind、Anthropic联合发表立场文件,提出CoT监测概念,认为是控制AI Agent核心方法。探讨其潜在机遇、局限,还提及不同公司对CoT监测的不同态度,如OpenAI乐观,Anthropic焦虑。
交大&华为联手:AI智能体进化的五种关键能力
随着大型语言模型兴起,基于LLM的聊天机器人能完成多样语言任务。上海交通大学和华为团队提出分析框架,探讨LLM聊天机器人向AI智能体进化的五个关键维度、改进方法及未来发展方向。
北大王选所彭宇新团队:让多模态大模型学会「看懂物种关系」丨CVPR 2026
北大王选所彭宇新团队在论文中提出TARA方法,引入生物分类学知识与多模态模型中间表征对齐。实验显示,TARA能提升模型层级识别和未知类别识别能力,还可加速训练收敛,计算开销小。
AI HR 挑选AI 简历,招聘市场正变成一场AI与AI的对决
LinkedIn求职申请过去一年激增45%,生成式AI是推手。求职者用ChatGPT优化简历、用AI代理申请,招聘方则用AI筛选和面试,还面临虚假身份问题。这引发对工作意义和真诚价值的思考。
DeepSeek开源MoE新利器LPLB:基于线性规划,专攻训练动态负载不平衡
DeepSeek在GitHub开源LPLB,这是基于线性规划的并行负载均衡器,用于优化MoE模型专家并行工作负载分配。它通过动态重排序、副本构建等机制实现动态负载均衡,支持多种拓扑结构,但也存在成本估算等局限性。
本周 5 个火火火的Github开源项目,每个都很有说法!
本周介绍5个Github开源项目。ai - berkshire将投资大师方法论系统化;stremio - web聚合视频资源;archify能将大白话描述变成架构图;Maple - font是优化的编程字体;Netcatty整合SSH客户端等功能。
高保真、多控制集成于「统一画布」,组合式图像生成新范式!
Canvas - to - Image是新型图像生成框架,将多种控制方式整合到统一画布,用户可直观操作生成高保真、多控制图像。它简化创作流程,解决了现有方法控制单一分散、交互性差的问题。
字节推出全新视频换装框架DreamVVT
视频虚拟试穿技术受关注,但现有方法有局限。字节推出DreamVVT框架,基于扩散变换器,分两阶段试穿,能应对多种复杂场景,不过也存在依赖遮罩、复杂动作表现不稳定等问题。