参考图像转视频」共找到 1474 篇相关文章

8

仅2G内存可跑,刚刚,谷歌开源Gemma 3n,端侧原生多模态!

谷歌全面发布Gemma 3n,将多模态AI功能带入边缘设备并在Hugging Face开源。它原生支持多模态输入输出,针对设备端优化,内存占用低,采用开创性架构,Gemma系列质量也不断突破。

PaperAgent
开源动态7

基于MCP协议的12306购票搜索服务器项目解析(附配置流程)!

文章介绍基于MCP协议的12306购票搜索服务器项目12306 - mcp,涵盖功能特点、技术架构、服务原理、数据流程、工具及安装配置,还给出GitHub地址,助开发者提升购票查询体验。

MCP Lab
新闻资讯8

AI大牛刘威创立的Video Rebirth,刚刚又完成8000万美元融资

AI视频生成企业Video Rebirth完成8000万美元融资,由AMD Ventures、现代汽车等跨界投资。其由刘威创立,首创Dual Diffusion Transformer架构,新资金用于Bach模型商业化与全球扩张。

机器之心
算法论文8

全新线性注意力范式!哈工深张正团队提出模长感知线性注意力!显存直降92.3%!

哈工深张正团队联合多团队发布论文,提出 NaLaFormer 框架,解决线性注意力两大核心缺陷,保持线性复杂度同时精度超越,在多任务表现出色,如超分任务显存降 92.3%。

机器之心
新闻资讯7

英伟达机器人掌门人Jim Fan年度复盘:Vibe Coding火出圈,机器人领域却依然焦头烂额

AK推文让Vibe Coding火出圈,而英伟达机器人负责人Jim Fan对2025机器人领域发展泼冷水,指出硬件可靠性差、Benchmark混乱、VLA路线存问题等现状,并分享3个教训,还回应网友质疑。

AI寒武纪
开源动态8

ICCV25 Highlight|格灵深瞳RICE模型狂刷榜单,让AI「看懂」图片的每个细节

格灵深瞳公司灵感团队自研的视觉模型基座RICE(MVT v1.5)刷榜多项视觉任务,在ICCV25获Highlight荣誉。它延续MVT系列理念,提升图片内部视觉特征差异性,在多任务验证中表现优异。

机器之心
产品应用8

稚晖君新大招:机器人二次开发0门槛了!

在智元机器人首届合作伙伴大会上,联合创始人稚晖君发布机器人动作与表达创作平台灵创平台。它以AI加持,能将机器人二次开发抽象成模块化工具,降低难度,适配多款机器人,10月上线beta版。

量子位
产品应用7

使用 GPT-5 进行编程的六个技巧

OpenAI给出使用GPT - 5编程的6个提示技巧,如指令准确无冲突、选对推理力度、用类XML语法结构化规则等,还提供了详细提示技巧的参考链接。

AI寒武纪
产品应用8

万万没想到,这家央企竟让香农和图灵又“握了一次手”

中国电信人工智能研究院研发布局的智传网(AI Flow),让信息技术和通信技术融合。在WAIC中,李学龙提出智传网三律,即信容律、同源律和集成律,打破传递智能的‘壁’,为数字世界带来深远影响。

量子位
产品应用7

解读Qwen3文本嵌入与重排序技术版图

文本嵌入和重排序是NLP和信息检索关键组件。Qwen3 Embedding、Qwen3 Rerank模型基于Qwen3基础模型构建,有三种参数尺寸。文章介绍其架构、训练方案,还给出实战代码。

CourseAI