视频运动控制」共找到 1437 篇相关文章

开源动态7

Ultralytics & lightly-train:简化计算机视觉模型训练,无需标签

在计算机视觉领域,获取带标签数据成本高、耗时长。开源项目 lightly-train 用未标记图像和视频自监督预训练,减少标注成本与时间,可集成到现有训练管道,支持多种模型架构和应用场景。

机器学习AI算法工程
产品应用7

“导演梦”不再遥远:Captain Cinema 让你用短片制作出电影

约翰·霍普金斯大学与字节Seed团队推出自动生成短片的Captain Cinema系统。它以剧情文字为输入,先规划关键帧,再补全画面动态合成短片。采用特殊训练法和模型,虽有局限,但为电影自动生成迈关键一步。

带你学AI
产品应用8

让大模型“跑”在手机里:vivo蓝心端侧部署创新揭秘,性能功耗双优!

在AICon2025上海站,vivo AI研究院工程师章苏迟分享蓝心大模型端侧部署方案。介绍端侧大模型优势及应用场景,阐述内存、性能、功耗等指标优化方法,还提及多业务场景应对策略与安全合规措施。

InfoQ
产品应用7

基于OpenAPI和AI coding的上云智能体构建实践

文章介绍基于OpenAPI和AI coding构建上云智能体的实践。分析不同编程范式,结合AI coding发展与Multi - Agent问题,阐述构建方案,包括业务场景、构建方法、技术实现、当前效果及后续展望,还提及文档智能与RAG构建LLM知识库。

阿里云开发者
开源动态8

无损加速视觉语言模型推理!轻松剪掉视觉冗余Token|腾讯AI Lab

多图像、长视频让大型视觉语言模型推理成本暴涨,成算力瓶颈。腾讯AI Lab联合CMU提出VScan,通过两阶段视觉token筛选机制,在几乎不损性能的前提下实现推理加速,且已在GitHub开源。

量子位
新闻资讯8

刚刚,马斯克切脑全场震撼!插脑只要1.5秒,26年治愈失明,28年全人类变AI

马斯克Neuralink发布会亮点多,全球已有七人植入设备,可通过脑机接口玩游戏、控制机械臂。马斯克公布三年路线图,2026年治失明,2028年人类与AI集成。第二代手术机器人提速,自研植入物创新数据传输模式。

新智元
新闻资讯8

从高考到实战,豆包大模型交卷了

火山引擎原动力大会 Force 2025 发布豆包大模型 1.6 等多项新产品。豆包 1.6 性能提升,在多方面表现出色;Seedance 1.0 Pro 视频生成能力强。大会强调‘AI 云原生’,还推出多个套件和技术进展。

机器之心
新闻资讯8

Veo 3全网实测惊艳所有人!DeepMind CTO:规模是AGI全部吗?

谷歌推出视频生成模型Veo 3,一句提示词就能打造电影质感短片,还能音画同步,引发网友惊叹。DeepMind CTO在访谈中表示,规模非AGI唯一要素,还提及Deep Think模式及Veo 3进展等。

新智元
新闻资讯7

刚刚!OpenAI正式官宣调整公司结构:奥特曼发全员信承认AGI会由多家公司实现

OpenAI宣布调整公司结构,非营利组织继续控制,盈利实体转型公益企业(PBC),采用常规股权结构,非营利组织成PBC大股东。Sam Altman称这非出售,是结构简化调整,目标是让AGI惠及全人类。

AI寒武纪
新闻资讯7

Gemini 3.8,明日登场!

最新爆料,Gemini 3.8 Flash明日登场,谷歌已放弃Gemini 3.5 Pro。其编程实力强悍,之前还为Gemini植入智能体视频理解功能,降本提效,可应对多种高难度场景。近期多家AI发布计划撞车,混战升级。

新智元