「互动视频」共找到 1102 篇相关文章
个人音频转录与交互神器
Speakr是个人自托管网络应用,可转录音频、生成摘要和标题,还能通过聊天互动。支持音频上传、浏览器录音等功能,可选择不同转录方式,有简单和高级两种安装方法。
All In AI的Google I/O 2025还开源了一系列模型,冲~
谷歌CEO称Google IO 2025上,数十年AI研究成果已成为现实。大会亮点多与AI相关,如Gemini 2.5系列模型表现出色,还有Veo 3等。此外,还开源了medgemma、gemma - 3n等模型。
编程奇点逼近,程序员斩杀线就在眼前!软件版YouTube时刻在发生
新智元报道,软件开发正迎来「YouTube时刻」,AI工具如Cursor、Claude Code等让编程变简单。A16z投资人预言App创建速率或飙升10倍,软件边际成本趋近零,人人可成开发者,不过程序员也面临被AI替代风险。
刚完成“卖身”重组,TikTok就瘫了!Oracle 背锅:暴风雪吹坏了数据中心
近日,TikTok 美国业务重组后出现大面积瘫痪,许多用户无法上传或观看视频。TikTok USDS 称是美国数据中心电力中断所致,Oracle 回应是冬季风暴让数据中心停电,TikTok 正推进恢复工作。
Nature 正刊收录!清华 FIB 实验室揭示:AI 提升科学家个人影响力,却收缩科学整体探索空间
清华大学 FIB 实验室牵头研究表明,AI 在自然科学应用广泛,提升科学家个人影响力,但使科学整体探索空间收缩。研究基于大量论文和人员数据,还提出科研智能体系统 OmniScientist 缓解问题。
AIGC超新星专栏丨玩AI的小笼包:我离开互联网大厂,用AI重新定义“内容总监”
北京AIGC视听产业创新中心对话‘玩AI的小笼包’。她曾是大厂内容负责人,后投身AIGC创作。她分享了创作转型经历、‘超创’生态及工业化生产流程,也谈及技术挑战与行业发展方向。
多模态推理新范式!DiffThinker:用扩散模型「画」出推理和答案
上海人工智能实验室等团队提出全新生成式多模态推理范式,发布模型 DiffThinker。它打破传统定式,以图像到图像生成任务重构推理过程,在多项复杂任务中表现优于顶尖闭源模型,有四大核心特性。
AI+直播的新玩法! StreamDiffusionV2让创意零延迟
生成模型改变直播行业,但此前模型难保证时间一致性、有延迟等问题。加利福尼亚大学推出StreamDiffusionV2,通过智能调度和缓存机制优化,支持多GPU并行,可灵活调画质和延迟,实现实时直播。
GAIR Live 预告|智能始于记忆,AgentMemory 的技术演化过程
在人工智能走向智能体阶段,‘记忆’成焦点。如今大模型‘记不住’上下文,‘从Human Memory到Agent Memory’跃迁是迈向具身智慧关键。GAIR Live将邀专家探讨记忆技术逻辑与路径。
NVIDIA重磅开源!OmniVinci 仅 9B 模型就拿下多模态冠军!
英伟达推出全模态大语言模型 OmniVinci,架构有三大创新。OmniVinci - 9B 模型表现亮眼,多测试中大幅超 Qwen2.5 - Omni,且训练量仅为其六分之一。其架构经多阶段流程实现全模态理解,还支持多种功能。