「参考图像转视频」共找到 1474 篇相关文章
机器人搬冰箱成了!洗碗之后又一痛点,网友:解放我的髋关节
波士顿动力最新人形机器人Atlas能搬动几十公斤重冰箱。它定位为干重活,动作模拟人类搬重物,训练靠强化学习,经参考轨迹、奖励函数、仿真训练、真机测试迭代。
OpenClaw 实战:一个人、一台 Mac、六个 AI Agent — 从"能聊天"到"能干活"的工程实战
本文分享 OpenClaw 实战经验,介绍 1 编排者 + 5 专业 Agent 团队运作,阐述上下文管理、记忆成长、多 Agent 协作等核心工程问题及解法,还给出系统搭建步骤和技术栈参考。
告别Sora!从巅峰到黯然离场不到一年半,团队将转向物理AI
2026年3月24日,OpenAI宣布关闭视频生成应用Sora。Sora曾惊艳全球,但因合规麻烦、行业阻击、算力成本高、商业回报低等问题走向关停。团队将转向物理AI,聚焦世界模拟研究。
罕见!Meta、OpenAI、xAI联合分享了用生产环境提升LLM的最佳实践!
Meta、OpenAI、xAI联合发表成果CharacterFlywheel,聚焦在生产环境提升社交型AI对话能力。团队基于LLaMA 3.1迭代15个版本,7/8的A/B测试显示正向提升,介绍了架构、数据管道、奖励模型等内容。
豆包 Seed 2.0 来了:字节模型跨越鸿沟
春节前字节发布豆包大模型 2.0,其在 Text 领域进入榜单前十,视觉能力全球第四且成本低。它定位多模态 Agent 模型,有多种能力升级,文中用多个案例展示其强大,还强调字节重原生能力非简单蒸馏。
多模态文本智能白皮书发布!5大能力标准、11个行业案例全解析(附下载)
合合信息发布《文本价值觉醒,赋能智能决策——多模态大模型文本智能白皮书(2026)》,提出复杂文本智能五大核心能力标准,还通过11个真实行业标杆案例展示技术如何转化文档为决策力。
推出 AnyLanguageModel:在 Apple 平台统一本地与远程大语言模型的 API
大语言模型是构建现代软件的重要工具,但 Apple 平台开发者集成模型困难。Hugging Face 发布 AnyLanguageModel,是 Swift 包,可替代 Apple Foundation Models 框架,支持多模型服务商,降低使用 LLM 难度。
Meta收购Manus最新进展:商务部介入,启动评估调查
2026年1月8日,中国商务部宣布会同相关部门对Meta收购Manus案开展评估调查,审查其与出口管制等法律法规的一致性。此次调查或使交易走向审查通过、需补办手续、认定违规三种情形。
爆火全网FLUX.2重磅上线,开源版Nano Banana来了!
Black Forest Labs的开源视觉模型FLUX.2上新,是专为现实创意工作流程打造的生产力工具。与前代相比,实现从「会画」到「懂你要画什么」跃升,还能在多方面保持一致性,各变体有不同定位与场景。
太炸裂了!全网实测Nano Banana Pro,网友:这模型里到底装了什么鬼东西!
谷歌Nano Banana Pro出世引发全网关注,它又名Gemini 3 Pro Image,整合多模态理解能力与知识库。普通用户可在Gemini应用免费体验,实测显示其实力强悍,还在网友手中玩出花,谷歌CEO也站台。