序贯策略优化」共找到 1966 篇相关文章

算法论文8

首次综述「边-云协同计算」,分布式智能与模型优化的最新进展

边缘 - 云协同计算整合边缘节点和云端资源,解决传统云计算问题。最新综述论文系统梳理其架构设计、模型优化等方面,提出统一框架,还指明未来研究方向,如大语言模型部署、6G整合等。

新智元
开源动态8

Identity-GRPO:阿里开源多人物定制化视频生成的后训练优化算法

阿里团队提出Identity - GRPO算法解决多人物视频生成身份一致性问题。构建约15000个标注样本数据集,基于Qwen2.5VL设计奖励模型,多项策略增强训练稳定性,实验验证性能提升显著。

PaperAgent
7

记录下SGLang开发,优化,debug的技巧之大SKILL时代已来临

文章记录SGLang开发等技巧,介绍Agent在编程开发领域的强大能力,如完成多种工作、提升模型速度。还提及Agent流程优化方向,提醒警惕其偏差,指出人的价值转变,成为设计、把关和提炼者。

GiantPandaLLM
推荐文章7

拆解、对比与优化:LLM工具智能体的五种任务规划与执行模式

文章探讨了大语言模型驱动的AI智能体的五种任务规划与执行模式,包括ReAct、Plan-and-Execute、静态Workflow、Workflow+局部智能、模块化的分层规划,分析其优缺点、适用场景,还给出优化方法。

AI大模型应用实践
新闻资讯7

Cloudflare 推出 Agent Tracing:支持截断限制,不同框架的 Payload 默认记录策略存在差异

Cloudflare推出Agent Tracing,可提供统一Dashboard查看已部署Agent会话。该功能在现有Workers Tracing基础上增加Agent级别的Span,有收费时间表。不同框架Payload默认记录策略有差异,Trace有截断限制。

InfoQ
新闻资讯8

AICon 2025 深圳回顾:AI Agent 爆火全场,管理与推理优化成新焦点

2025年8月22 - 23日,AICon全球人工智能开发与应用大会在深圳落幕。70+嘉宾、800+开发者与企业代表参会,议题覆盖AI Agent、推理优化等。AI Agent成全场焦点,企业管理议题意外走红,展示了AI深入各领域的趋势。

AI前线
开源动态8

MetaShuffling:Meta的Fused MoE kernel工程方案,更激进的Kernel优化和尽量避免Padding

文章介绍Meta的Fused MoE kernel工程方案MetaShuffling,可高效部署Llama 4模型。它处理MoE推理挑战,介绍多种token选择路由方案,阐述运行时设计、不同并行化方式及优化思路,还展示性能测试与Trace分析。

GiantPandaLLM
算法论文8

10步优化超越强化学习,仅需1条未标注数据!后训练强势破局

无监督的熵最小化(EM)方法仅需一条未标注数据和约10步优化,就能显著提升大模型在推理任务上的表现,甚至超越依赖大量数据和复杂奖励机制的强化学习(RL)。EM为大模型后训练提供了更高效简洁的新思路。

新智元
产品应用7

企业官网GEO优化:可直接复制JSON-LD+llms.txt模板(适配AI推荐)

文章提供企业官网GEO优化方案,含首页、FAQ页结构化代码及llms.txt模板,还有通用FAQ选题。介绍使用方法、上线校验步骤和生效判断标准,助企业适配AI推荐。

孔生SEO
推荐文章8

一文全解析:AI 智能体 8 种常见的记忆(Memory)策略与技术实现

本文剖析8种常见AI记忆方案,如全量记忆、滑动窗口等,分析其原理、特点和适用场景,还给出模拟代码助理解。不同策略各有优劣,适用不同对话场景,能为项目评估、选择和实现Memory方案提供参考。

AI大模型应用实践