「协同解码策略」共找到 1342 篇相关文章
刚刚,OpenAI开放GPT-4.1偏好优化DPO,ChatGPT能真正学会你的「品味」了!
OpenAI宣布GPT - 4.1全系列模型支持DPO微调,可让AI通过对比回答学会用户偏好。介绍了DPO原理、适用模型、数据格式、创建任务方法等,还提及开发者反应与技术要点。
不是,高考刚结束,高考报志愿的Agent也来了?
夸克官宣夸克高考志愿大模型,虽未多提Agent,但作者认为其比Agent还Agent。该模型免费,以Qwen为基座,结合高考知识库,能生成详细志愿报告,考虑多方面需求,助力学子报志愿。
深度学习中Batch Size对训练过程如何影响?
文章分析深度学习中batch size对训练过程的影响,探讨超大batch优缺点及应对方法。用面试、通俗、科学三种方式解答问题,还通过MNIST实验,从迭代速度、梯度平滑程度、收敛速度等指标对比不同batch size情况。
突发!美国新法案,10年内禁止监管AI
美国众议院通过《HR1》法案,未来10年禁止各州监管AI。该法案对科技巨头有利,赞成者认为可终结各州AI法律拼凑局面,反对者觉得会让消费者失去保护。法案还涉及资金扶持等内容。
RL训练总崩溃?R1-Reward稳定解锁奖励模型Long-Cot推理能力
多模态奖励模型对提升多模态大语言模型表现至关重要,但强化学习在奖励建模应用有挑战。快手等团队提出R1 - Reward,解决训练不稳定等问题,在基准上超SOTA模型,还在快手业务场景成功应用。
一个LoRA实现GPT-4o级图像编辑!浙大哈佛新模型冲上Hugging Face榜二
随着Gemini、GPT - 4o等把基于文本的图像编辑推向高峰,提高性能常需大量数据和大参数量模型。而浙大哈佛团队提出ICEdit,用少量数据和参数实现高质量图像编辑,媲美甚至超越商业大模型。
1400亿Agent入场,“流量”这条护城河要塌了
在支付宝AI生态大会上,蚂蚁集团CEO韩歆毅提出Agent时代流量逻辑失效、信任逻辑崛起。他还指出人的流量让位于智能体生态,Agent重构商业决策权,AI支付将成全球新基建。
「虾马」之后,openJiuwen社区发布JiuwenSwarm,引领蜂群智能体新架构,开启「养蜂」时代
华为支持的开源AI Agent平台社区openJiuwen发布并开源蜂群智能体JiuwenSwarm,按下“群体智能”加速键。它基于Coordination Engineering理念,有全栈技术体系,在多领域实战效果好,且单Agent能力强。
为训推加速!全新FlashQLA注意力算子库开源
自Qwen3-Next发布,GDN成Qwen主力注意力层,随模型规模扩大开销增大。现开源FlashQLA算子库,融合优化GDN Chunked Prefill前反向算子,在NVIDIA Hopper上多场景加速,提升预训练和端侧推理效率。
继Harness之后,“龙虾”JiuwenClaw率先开启“Coordination Engineering”时代
AI工程范式迭代快,行业面临‘定义赶不上进化’的焦虑。华为支持的openJiuwen社区发布新版JiuwenClaw,新增多智能体协同能力,提出‘Coordination Engineering’,实测中表现出高稳定性,可自主完成多项任务。