多模态玩法」共找到 1447 篇相关文章

推荐文章7

分享6个平时我最常用的Prompt心

作者作为常靠AI帮忙的普通用户,分享6个与AI对话的心技巧。包括让AI选角色回答、回答前追问、与AI辩论、预演失败、反向推提示词和双层解释,助大家与AI有效协作。

数字生命卡兹克
新闻资讯8

老黄All in物理AI!最新GPU性能5倍提升,还砸掉了智驾门槛

英伟达CEO黄仁勋在CES 2026发布AI新品,全力搞AI。推出下一代Rubin架构GPU,性能大幅提升;发布五大领域成果,含新模型家族、平台等;还开源训练框架与多模态数据集,国产开源模型被提及。

量子位
新闻资讯8

谷歌用Gemini 3同时革了OpenAI和英伟达两家的命

谷歌发布Gemini 3全家桶,打断英伟达和OpenAI双赢美梦。它实现原生多模态,对OpenAI构成代际优势;用TPU训练模型,摆脱CUDA依赖,冲击英伟达算力神坛。谷歌全栈自研,其发展或改变AI格局。

新智元
产品应用8

30秒,我用蚂蚁灵光复刻了个支付宝(doge)

蚂蚁集团推出全模态通用AI助手灵光,最快30秒生成私人定制小APP,可编辑交互分享。实测其功能丰富且专业,实现多模态输出和多智能体协作。还对比了与千问区别,介绍蚂蚁AGI布局。

量子位
产品应用8

用完这张无限可能的AI画布,第一次感觉人类导演要失业了!

2024年7月上线后迅速风靡海外的SkyReels发布最新版本,它重构AI创作生态,打通「图片—音频—视频」全栈,集成多种功能于一张画布,还推出专家智能体,让普通人轻松创作高质量内容。

新智元
开源动态8

3B Image Captioning小钢炮重磅来袭,性能比肩Qwen2.5-VL-72B

文章推荐Dense Image Captioning新技术CapRL,它首次将DeepSeek - R1强化学习用于image captioning,创新定义reward。训练的CapRL - 3B模型性能比肩Qwen2.5 - VL - 72B,解决了reward设计难题,已开源相关内容。

机器之心
算法论文8

用中等难度prompt做高效post training

近年来,RL后训练在LLM发展中至关重要,但传统方效率低。本文提出PCL轻量级算,通过动态选中等难度提示提升LLM后训练效率,经多基准实验验证其优越性,也指出方局限与未来方向。

深度学习自然语言处理
算法论文8

NeurIPS 2025 Spotlight | FSDrive统一VLA和世界模型,推动自动驾驶迈向视觉推理

面向自动驾驶的多模态大模型存在问题,FSDrive提出“时空视觉CoT”,让模型“以图思考”,联合未来场景与感知结果进行可视化推理。该方在不改动原有MLLM架构前提下激活图像生成能力,实验表现出色。

机器之心
开源动态8

一周10来个模型被开源,阿里Qwen杀疯了~

阿里通义千问这周开源众多模型,如Qwen3 - Omni、Qwen - Image - Edit等,涉及全模态、图像编辑、安全审核等多领域。各模型能力出色,如Qwen3 - Omni能处理多模态输入,Qwen3 - VL表现超部分闭源模型。

PaperAgent
算法论文8

CJA|西工大林海涛、张伟伟等:关联函数学习:适用飞行器外形泛化的稀疏气动数据重构方

本文提出关联函数学习(SFL)方,通过符号回归挖掘气动力系数复合函数表达式,实现非线性气动数据稀疏重构与状态外推。用少量样本构建数据库,误差 1%-5%,比 Kriging 样本量减超 90%。

力学与人工智能