「深度学习研究」共找到 3476 篇相关文章
LightX2V Ulysses Attention 实现学习笔记
本文记录了LightX2V中Ulysses Attention的实现方式与张量形状推导。在多模态/视频场景,其实现可概括为一种layout变换,还提供`enable_head_parallel`和`use_fp8_comm`选项,效果受运行环境等因素影响。
重磅!翁荔最新Scaling Law深度洞察来了
北大毕业的前OpenAI高管翁荔(Lilian Weng)的《Scaling Laws, Carefully》值得一读。Scaling law是预训练预算表,能帮少烧错钱。文章探讨大模型训练预算分配,分析Kaplan和Chinchilla结论差异及数据稀缺问题。
The Batch: 939 |在推理阶段学习长上下文
大型语言模型处理长上下文时通常准确性降低、速度变慢,研究人员提出TTT - E2E方法,通过推理时训练模型将上下文压缩到transformer权重中,还展示了其运作方式、测试结果等。
阿里新研究:统一了VLA和世界模型
阿里达摩院等提出WorldVLA框架,融合视觉语言动作模型与世界模型。它用三套分词器编码,解决传统自回归模型问题,经联合训练,实验显示其性能优,两模型还能相互助力。
初识App Store和苹果审核【第一期】深度解析
App Store的审核流程和苹果惩罚机制究竟是怎样的?文章详细解析了App Store的变迁、分发模式、开发者账号区别、上架流程、审核流程和依据,以及惩罚机制和应对方式。
ACL 2026 | 腾讯混元Agents工具学习新范式
腾讯混元团队在 ACL 2026 Findings 发布的 ToolCPT 指出,Agent 用不好工具病根在预训练。它从真实代码挖工具,写说明书,融入预训练,实验显示能有效提升工具运用能力,但也有局限和成本。
大佬深度解析:Coding Agent的底层运行逻辑是什么?
本文由AI领域知名学者Sebastian Raschka撰写,探讨编码智能体及其编排的设计、工作原理和组件协同。指出智能体周边支撑系统重要性不亚于模型本身,详细阐述编码智能体六大核心构建模块。
AI编程学习:Chrome DevTools MCP 到底有多强?
作者体验了Google新出的Chrome DevTools MCP,它在小红书自动发帖、YouTube智能观看等场景表现出色。与Playwright对比,其Token消耗低、报错处理稳。还揭示设计思路差异,给出上车指南。
独家 | 字节跳动机器人研究一号位孔涛离职创业
AI科技评论独家获悉,字节跳动机器人团队负责人孔涛6月初离职创业,团队已有数人离职,字节正招继任者。字节此前在机器人领域加大投入,2024年10月海外发布GR - 2模型。业界认为字节需更大决心突破。
谷歌前CEO深度专访:AI、智能体会重塑世界
谷歌前CEO Eric Schmidt在Ted专访中,从AI起点AlphaGo说起,阐述其从大模型到自主决策智能体的发展,还提及算力电力需求增长、监管、开源等问题,虽挑战多,但他对AI重塑世界充满信心。