「VAE-LLM数据增强」共找到 3310 篇相关文章
社区供稿 | Index-AniSora 技术升级开源: 动漫视频生成强化学习
B站升级动画视频生成模型Index - AniSora技术并开源,支持多种二次元风格视频镜头一键生成。基于相关研究提出首个专为二次元视频生成的强化学习技术框架,构建奖励数据集、训练AnimeReward、提出GAPO优化策略,实验验证其有效性。
必看!Sebastian Raschka新博客盘点了所有主要注意力机制
著名AI技术作家Sebastian Raschka发布博客《现代LLM中注意力变体的可视化指南》,回顾近年开发并用于开放权重架构的注意力变体,包括多头、分组查询、多头潜在等注意力机制,还分析各机制特点、应用场景及优劣势。
奥特曼重磅发声:全AI公司是未来!OpenAI官宣Frontier,让管理Agent像管人一样简单
OpenAI推出智能体中枢平台Frontier,可整合企业系统与数据,让智能体稳定运行。目前Anthropic在企业级大模型市场份额领先,OpenAI想借Frontier卡位。该平台已获多家巨头试用,有望拉开AI扎根企业核心业务时代序幕。
Karpathy最新手搓!复现GPT-2成本狂降600倍:仅需507元3小时训练「最好的AI学习项目」
Andrej Karpathy的个人项目nanochat更新,现训练GPT - 2级别的LLM成本低于100美元,在单个8XH100节点上仅3小时花约73美元,较7年前成本降600倍,还列出关键优化技术,设排行榜。
长达790年视频镜头,打造原生多模态世界模型!北京智源研究院用Emu3.5统一“世界”
北京智源研究院发布并开源基于原生多模态训练的世界学习者Emu3.5,它将视觉和语言视为同一种数据流,在超13万亿token数据上学习,解决长视野多模态信息处理问题,经多阶段训练和优化,能力强大且已开源。
首个实例理解3D重建模型!NTU&阶越提出基于实例解耦的3D重建模型,助理场景理解
人类能自然感知3D世界的几何与语义,但AI做到“两者兼得”是挑战。NTU联合StepFun提出IGGT,将空间重建与实例级上下文理解融为一体,还构建了InsScene - 15K数据集,解决了传统方法的问题。
卡帕西:强化学习很糟糕,但其他所有方法都更糟
卡帕西在近两小时访谈中解答诸多问题。他认为AGI成熟约需十年,现有的LLM有认知缺陷,强化学习糟糕但其他方法更差,AGI将延续2%GDP增长趋势,还谈及自动驾驶、教育等方面看法。
首次结合RL与SFT各自优势,动态引导模型实现推理⾼效训练
新一代大型推理模型在复杂推理有进展,核心是ZERO - RL训练法。华为香港研究所小艺团队等合作推出GHPO算法框架,融合在线强化学习与模仿学习,解决了RLVR方法局限,提升模型训练效果,代码数据开源。
超越DeepSeek-R1,英伟达开源新王登顶!14万H100小时训练细节全曝光
英伟达Llama - Nemotron系列模型超越DeepSeek - R1且全部开源。论文揭秘其训练关键,如用合成数据监督微调与强化学习等。还介绍构建阶段、架构设计等,评估显示该系列模型在多任务表现出色。
最新豆包、deepseek、元宝、夸克、千问、百度、文心、Kimi、微信搜一搜、抖音、小红书等AI搜索生成内容引用来自哪些地方?【干货】
作者白杨SEO指出,生成式人工智能发展快,AI搜索优化GEO受关注。介绍了豆包、DeepSeek等多个AI搜索生成内容引用来源,如豆包引用抖音、头条等,DeepSeek用开源数据等,还提及各平台优化要点。