「视频总结」共找到 1206 篇相关文章
万字总结:如何练就适配人形机器人的可靠「灵巧手」?|GAIR Live
在具身智能崛起时,灵巧手成人工智能落地核心突破口。2025年5月25日相关线上沙龙中,嘉宾围绕灵巧手软硬件、数据与模型、落地应用等交流,探讨数据难题、开源价值、落地挑战及中美差距等。
基于Agent的SGLang Diffusion Kernel优化实践:Qwen-Image、FLUX.2和视频模型
本文记录基于Agent完成Qwen-Image、FLUX.2、Wan和SANA Video优化的过程,包括定位问题、写Kernel及遇到的坑。介绍SGLang Diffusion Kernel结构,分析数值敏感原因,展示各模型优化实践、无收益实验及验证流程。
5V5电竞版Prompt Battle来了,这是AIFUT大会最后的总结。
AIFUT大会结束,最后半天有圆桌、演讲与Prompt Battle电竞赛。余轶南谈具身智能和家庭机器人;5v5电竞赛红队夺冠;神思远等探讨影视行业;快刀青衣等交流AI创业;张泓等讨论AI投资;吕思彤分享开发经验。
年终总结,通用Agent在企业落地,为什么这么难?到底要怎么做?
文章指出通用Agent在企业落地难,原因有模型本身问题、工程化落地难度被低估、安全合规要求高。还介绍金蝶苍穹Agent平台,它嵌入企业管理场景,有业务模板、开放标准和安全保障。
“AI版LeCun”自己讲解论文,自我进化智能体框架生成精美演讲视频
加州大学研究者提出自我进化的学术演讲智能体框架EvoPresent,它由四个智能体协作,核心美学模型PresAesth模拟人类审美判断。团队构建评测体系,实验显示其在内容与视觉设计上提升显著,让AI兼顾逻辑与美感。
NeurIPS Spotlight|运动遮挡都不怕,0先验、一段视频精准预测相机参数
论文一作李放等为解决传统方法在动态场景预测相机参数的难题,提出 ROS - Cam 方法,涵盖补丁式跟踪滤波器、异常值感知联合优化、双阶段训练策略,代码即将开源。
从BERT到T5再到Qwen3:关于Embedding的八点总结
哈工大30+页综述聚焦通用文本嵌入(GPTE),系统介绍其架构、数据、模型,探讨预训练语言模型(PLM)给GPTE带来的基础能力与高级扩展,还涉及多模态、多语言、代码嵌入等应用。
重磅!OpenAI深夜发布ChatGPT Agent:AI打工人正式上线「附发布会全程视频」
OpenAI推出ChatGPT Agent,它整合Operator远程浏览器和Deep Research能力,Pro、Plus和Team用户可激活。能完成复杂任务,有强大工具集,性能在多基准测试超人类,但OpenAI因能力增强启动最高安全保障。
文旅新玩法!藏师傅教你做食物微缩景观宣传海报&视频
作者玩 Gpt - 4o 图片生成时,用食品做键盘图,又结合食物与城市做微缩场景海报,还用 Veo3 做微缩景观生长动画,给出各工具提示词,鼓励大家尝试。
腾讯纯文本LLM训视觉encoder,拿捏图表长视频,达到开源小模型SOTA!
腾讯开源Penguin - VL,直接用纯文本LLM训视觉编码器,跳出传统多模态拼接套路。在2B/8B紧凑参数规模的复杂任务中竞争力强,训练分三阶段,相关代码、模型等已开放。