全场景人工智能」共找到 3911 篇相关文章

产品应用7

实测惊艳球的Veo3!音画同步无敌,贵是有原因的

谷歌开发者大会推出的Veo3模型,具备强大文本和图像转视频能力,首次实现视频与音频同步生成。实测中,它生成的视频音画效果惊艳,但也有翻车情况,谷歌还给出提示词编写指南。

机器之心
推荐文章8

YOLOv8 模型训练入门指南:手把手搞定目标检测AI

本文是从零训练 YOLOv8 模型的完整实录,介绍了 YOLOv8 特点,以“识别猫”为例,详述训练步骤,指出训练难点,还推荐学习资源与工具,鼓励前端程序员尝试做 AI 模型训练。

AI Reading Hub
开源动态8

智元机器人发布并开源首个机器人动作序列驱动的世界模型

智元机器人发布并开源球首个基于机器人动作序列驱动的具身世界模型 EVAC 及具身世界模型评测基准 EWMBench,构建新开发范式,解决具身智能演进制约,提升策略模型筛选与训练效率。

InfoQ
产品应用8

帮大模型提速80%,华为拿出昇腾推理杀手锏FlashComm,三招搞定通算瓶颈

在大模型推理通算难题凸显的背景下,华为数学家祭出 FlashComm。它包含三项技术,分别在 AllReduce 通信、以存换传、多流并行方面优化,解决通信瓶颈,提升推理性能,未来还将围绕多方向创新。

机器之心
新闻资讯8

All In AI的Google I/O 2025还开源了一系列模型,冲~

谷歌CEO称Google IO 2025上,数十年AI研究成果已成为现实。大会亮点多与AI相关,如Gemini 2.5系列模型表现出色,还有Veo 3等。此外,还开源了medgemma、gemma - 3n等模型。

PaperAgent
开源动态8

卡内基梅隆大学开源LegoGPT,用AI设计乐高模型

卡内基梅隆大学开源LegoGPT,可依文本提示生成物理乐高模型。它把乐高设计转为自回归文本生成任务,基于LLaMA - 3.2 - 1B - Instruct微调,应用场景广泛,如教育、玩具设计等。

AIGC开放社区
推荐文章7

智源技术分享:大模型行业应用新模式和关键实现路径

在 AICon 大会上,智源研究院周华分享大模型行业应用。分析落地问题,提出以大模型为核心的技术路径,涵盖数据、训练等环节,还给出数据生产流程建议,分享最新开源成果。

InfoQ
产品应用8

缓存不该困在一台服务器里

本文分析大模型推理阶段KV缓存的行业痛点,指出传统单机缓存孤立无法跨节点复用的问题,介绍焱融科技的分层共享缓存方案,公开了方案的实测性能数据,展现AI存储的新发展方向。

InfoQ
新闻资讯8

刚刚,中国AI天团杀向RSI!1分钟预测球天气、20分钟手搓OS

本文报道上海人工智能实验室等多家机构联合发布智能体模型Atria Dawn Preview,该模型可1分钟预测球天气、20分钟搭建MiniOS,团队同时分析AI研发中的人机分工,披露最新协作数据。

新智元
新闻资讯8

Lex Fridman 对话 DHH:Omarchy,才是真正属于 Agent 时代的操作系统

Omarchy 有望成今年最火 Linux 桌面系统、首个 Agent 时代操作系统。开发者 DHH 曾怀疑 Agent 编程,现 Quattro 代码由 Agent 编写。DHH 做客播客,谈 Omarchy、AI 时代操作系统变化等。

Founder Park