「在离线混部」共找到 8177 篇相关文章
Skills:从编程工具的配角到Agent研发的核心
文章探讨了Skills在AI Agent发展中的价值演变与适用场景,指出其价值具高度场景依赖性。在Claude Code编程工具中它表现平淡,在Agent研发中价值凸显,还给出使用场景判断维度与发展方向。
博士宿舍激情脑暴,革新了Scaling Law?Qwen和浙大联手推出新定律,直接干掉95.5%推理内存!
近日,阿里与浙大合作提出并行计算缩放定律 ParScale,可在不增参数下提升大模型能力,推理效率更高。它通过引入并行流实现,在数学、编程等任务表现佳,适合边缘设备,代码已开源。
刷榜风波惊动OpenAI后,这家中国团队拿回Agent硬核榜单第一
在OpenAI主导的MLE - Bench基准测试上,百度伐谋2.0击败对手登顶。此前有团队刷榜引发风波,官方新增清洁赛道。伐谋2.0在多方面优化,还在汽车、金融、科研等产业落地解决难题。
DeepMind再登Nature:AI Agent造出了最强RL算法!
Google DeepMind团队提出DiscoRL,让智能体在多环境交互中自主发现强化学习规则,无需人类设计。它在Atari基准中击败MuZero,在未见过的游戏中也稳定高效,相关研究登《Nature》。
对抗协作+原型学习!深北莫FedPall开源,联邦学习破局特征漂移,准确率登顶SOTA
深圳北理莫斯科大学人工智能研究院在ICCV发表FedPall算法,结合原型对比与对抗协作学习,在多种特征偏移数据集获SOTA性能。该算法通过多步骤训练缓解特征漂移,在多个公开数据集表现出色。
Sebastian Raschka 2026预测:Transformer统治依旧,但扩散模型正悄然崛起
知名AI研究员Sebastian Raschka预测2026年,Transformer架构在未来至少一到几年仍占统治地位,但会在效率和混合上微调。同时,扩散语言模型虽有工具调用缺陷,但在数据稀缺时或成更好的学习者。
RL训练总崩溃?R1-Reward稳定解锁奖励模型Long-Cot推理能力
多模态奖励模型对提升多模态大语言模型表现至关重要,但强化学习在奖励建模应用有挑战。快手等团队提出R1 - Reward,解决训练不稳定等问题,在基准上超SOTA模型,还在快手业务场景成功应用。
八年后,Meta教会了Transformer「显式思考」
10月20日Meta上线新论文《The Free Transformer》,作者François重写Transformer思维方式,造出Free Transformer新架构。它在解码器内加入随机潜在变量,让模型生成内容前先‘思考’,实验显示在多任务上性能显著提升。
2篇论文,最新上下文工程技术一次性讲透!
上下文工程技术持续火热,文章分享10月两篇相关论文。ACE让模型给自己写「战术板」,在多任务表现优;SA - ICL让LLM先搭框架再做题,在化学/物理准确率提升显著,还对二者做了横向对比。
LangChain 推出开源异步编码智能体 Open SWE
LangChain发布开源异步编码智能体Open SWE,可在云端处理复杂开发任务,能集成到开发者工作流。它连接GitHub仓库,在沙箱运行,强调人在回路控制,多智能体架构保障代码质量,早期反应褒贬不一。