「图像到视频」共找到 3230 篇相关文章
谷歌:全栈AI之王
随着Gemini 3模型与第七代TPU的发布,谷歌打破OpenAI与英伟达主导的市场叙事。其全栈AI战略从底层基础设施到用户产品全覆盖,TPU进化、软硬件契合,吸引大客户,C端产品成发展引擎。
NVIDIA 开源 Live VLM WebUI:摄像头实时测试视觉语言模型
NVIDIA 开源 Live VLM WebUI,可让用户在本地用摄像头实时测试视觉语言模型。它基于 WebRTC 技术,能将摄像头视频流实时传输给模型,分析结果叠加在画面上,支持多后端、多平台及多种模型。
传统云还在「卖铁」,下一代云已在「炼钢」:火山引擎xLLM如何一张卡榨出两张的性能!
大模型上线部署时推理成本高、算力投入大但效果不成正比,企业面临推理效率难题。火山引擎 xLLM 大语言模型推理框架性能极致,成本低,集成关键创新,还被集成到 AI 云原生推理套件 ServingKit 中。
OmniWork:面向创作者的 Agent OS
文章介绍了面向创作者的 Agent OS OmniWork,它的 Agent 围绕专业方向定制,Expert 和 Skill 可自行创建,能多 Agent 协作。通过实例展示其从热点捕捉到生成 BP、文章创作等功能,还介绍了底层逻辑,适合创作人群。
马斯克「世界模拟器」首曝,1天蒸馏人类500年驾驶经验!擎天柱同脑进化
特斯拉官宣「世界模拟器」,可模拟、合成自动驾驶的「孪生世界」,生成不同视角和长尾场景。它基于端到端神经网络,有学习人类价值观等优势。还能用海量数据解决难题,输出可解释中间结果,为自动驾驶和擎天柱训练服务。
聊聊AI应用架构演进
本文按AI应用架构演进路线,介绍每次演进增加的架构内容及相关技术,涵盖从简易架构到Agent模式等各阶段,还提及监控、推理性能优化等,助读者整理新技术,为探讨AI与传统应用架构异同做调研。
Claude Fable 5怎么用?Anthropic 工程师:干你也不知道的事
Anthropic的Claude Code工程师Thariq Shihipar发长文介绍Fable 5使用方法。他认为与Fable 5协作要发现未知,其定位解决复杂问题。还将未知分类,给出任务前中后打法,并举例用Fable 5剪视频。
Zed 为什么不用自己造 Agent?OpenAI 架构师给出答案:Codex 重划 IDE × Coding Agent 的分工边界
Coding agents 是应用型 AI 活跃领域,但团队常重复构建脆弱基础设施。OpenAI 的 Codex 提出“模型和 Harness 共同构建”,架构师介绍构建挑战与使用模式,还阐述了将模型适配到 Harness 的问题及未来发展方向。
马斯克的「移动客厅」又火了:20人座无方向盘,每公里才3毛钱
前段时间旧金山大停电,Waymo无人驾驶出租车趴窝,特斯拉汽车不受影响。网友翻出特斯拉Robovan视频,马斯克称其将改变街道面貌。该车20人座无方向盘,运营成本低,预计2027年量产,此外马斯克身价破7000亿美元。
100 页 Agentic RL 综述!牛津、新国立、AI Lab 等联合定义 LLM 下半场
2025 年大语言模型热潮持续,但当前主流训练范式显瓶颈。牛津、新国立等 16 家机构学者发布 100 页 Agentic RL 综述,明确定义从‘会说’到‘会做’进化路径,剖析理论、结构与实践,展望未来挑战。