音视频智能」共找到 4264 篇相关文章

推荐文章7

跨OS GUI智能体基础设施白皮书——重新定义人机交互自动化|甲子光年智库

《跨OS GUI智能体基础设施白皮书》由庭宇科技和铸基计划联合发布,剖析GUI Agent市场格局、技术路径与落地场景。指出其引发人机交互革命,能突破API局限,还介绍产品形态、发展挑战等。

甲子光年
开源动态8

字节清华智能体自动写CUDA内核,比torch.compile加速2.11倍

字节Seed与清华AIR团队开源CUDA Agent,在GPU内核优化基准KernelBench上成绩优异。它是大规模智能体强化学习系统,训练数据经多阶段构建,分阶段训练,全面超越商业模型,还开源了训练数据集。

量子位
产品应用8

智元首发SOP系统:打破离线训练瓶颈,让具身智能在“干中学”

2025年VLA让机器人有通用性,但真实部署存问题。智元机器人具身研究中心提出SOP在线后训练系统,融合在线学习等,使机器人在真实环境持续进化,实验显示其能提升性能、效率,突破VLA瓶颈。

量子位
推荐文章8

从WAIC上爆火的功夫机器人,看到这家央企的具身智能「真功夫」

今年4月“功夫boy”机器人出圈,3个月后的WAIC上它全新升级。其背后是中国电信人工智能研究院(TeleAI),由李学龙教授带领。他们技术栈全面,在硬件、软件、数据等方面全栈自研,还布局智传网,未来发展潜力大。

机器之心
算法论文8

集成20+先进算法,优于GPT-4o,自主因果分析智能体来了

加利福尼亚大学圣迭戈分校研究团队提出自主因果分析智能体 Causal - Copilot,集成超 20 种算法。它解决因果分析使用门槛高、预训练模型有局限等问题,性能优于 GPT - 4o ,已开源邀全球研究者参与。

机器之心
开源动态8

谷歌AI Agent刚开源!多任务智能体+MCP+谷歌搜索,狂揽9000颗星

今天凌晨,谷歌在官网开源AI Agent框架Gemini CLI,将Gemini大模型融入终端。它能调用视频和图像模型,集成MCP、谷歌搜索等功能,还集成超强编码助手,刚开源就在Github超9000颗星。

AIGC开放社区
算法论文8

SIGCOMM 2025|重新定义个性化视频体验,快手与清华联合提出灵犀系统

快手与清华孙立峰团队联合发表论文,提出灵犀系统,这是业界首个大规模生产环境中面向用户个性化体验的自适应视频流优化系统。该系统能解决现有方法在部署中的难题,实现个性化QoE优化。

机器之心
新闻资讯7

AI甚至开始抢土木老哥的工作了

即便土木、建筑等传统行业,也受AI冲击。建筑业用AI克隆老师傅、替代部分人力,如Procore推出多款AI智能体,Skanska建立AI安全智能体。建筑AI生态矩阵正形成,国内需相关工具。

新智元
开源动态7

SGLang|SGLang Diffusion

来自SGLang开源社区的Yichi介绍SGLang Diffusion,它是面向图像与视频生成的全开源扩散模型推理引擎。基于SGLang机制将能力迁移到扩散模型推理,能显著提速工作流,视频展示了多种功能。

GiantPandaLLM
产品应用7

比修驴蹄还魔性!谷歌这7段纸片动画,看完焦虑没了,第2支直接封神

全球网友爱刷解压视频,谷歌Gemini下场做带提示词的解压视频。它推出7段纸艺动画,包括火烈鸟起舞、圣托里尼落日等,靠高精准提示生成等打造,拓展想象边界,是通往美学与治愈的桥梁。

新智元