「多模态聊天」共找到 1092 篇相关文章
类R1训练不再只看结果对错!港中文推出SophiaVL-R1模型
DeepSeek - R1爆火后,类R1结果奖励训练范式引发推理热潮,但仅以结果对错奖励模型有弊端。港中文联合团队发布多模态推理模型SophiaVL - R1,引入‘思考奖励’机制,还用Trust - GRPO算法解决奖励欺骗问题。
国内首套:港中文团队发布7模态人体动作数据集,揭开大模型理解能力短板
港中文邢国良教授团队博士生蒋思阳完成 CUHK-X 多模态人体动作数据集,成果被 ACM MobiSys 2026 接收。用其测试主流大模型,发现理解人类动作平均正确率仅四成。该数据集数据收集方法反常规,还开展了基准测试。
打工人五一自救指南:把活全甩给AI,准备免打扰出门
五一将至,为避免假期工作内耗,可安装百度智能云打造的AI助手DuMate。它支持多模态理解与生成,能跨应用完成复杂任务。经测试,它可高效处理整理文件、生成报告等工作,还能并行处理多项任务。
Meta 143亿挖角后首个作品来了:Alexandr Wang 推出闭源模型,杨立坤点赞
沉寂9个月后,Alexandr Wang带队的Meta发布新一代模型Muse Spark。它是原生多模态推理模型,性能媲美Gemini Pro和GPT 5.4,Meta还披露技术实现细节。不过闭源引争议,且模型在长时程智能体等方面有短板。
AI能帮忙厨房看火了!面壁智能开源全模态模型MiniCPM-o4.5,边看边听还能主动抢答
面壁智能开源全模态模型MiniCPM-o4.5,能边看边听还主动抢答。它引入全双工多模态实时流机制,在多方向达全模态模型领先水平。该模型是端侧原生,将与开发板配套,助力端侧智能硬件开发。
7×24h「全职AI员工」爆火硅谷!退休码农让Mac mini一夜卖爆
由Peter Steinberger开发的开源项目Clawdbot爆火硅谷,它可在Mac mini上运行,能调用多种模型,还能通过聊天APP对话。它解决了主流大模型记忆力痛点,重塑了个人AI超级助手定义,还带火了Mac mini。
当顶级视频模型半衰期只有 30 天,fal.ai 为什么收入反而一年增长 60 倍?
在生成式媒体技术发展背景下,fal.ai 作为生成式媒体 infra 公司迅速崛起。它通过统一 API 与云端平台提供多模态模型调用能力,2025 年收入增长 60 倍并完成融资。文章解析其如何构建护城河及对行业发展的判断。
这才叫AI原生应用:Google Slides
Google Slides是Google版AI PPT,与传统AI PPT不同。它像传统PPT搭配AI聊天机器人,用Nano Banana模型可直接生成图片和文字,能像素级推理,打破传统PPT结构,还可自然语言交互修改,只是中文生成效果待提升。
当LeCun还在「画饼」,中国AI大牛领先李飞飞一步把世界模型开源了
具身智能突破「遥操作」数据桎梏,商汤联合创始人王晓刚领衔的大晓机器人发布全球首个开源商业落地世界模型「开悟3.0」。它是多模态理解 - 生成 - 预测一体化,有强物理感知力,还解决了空间感和时间记忆问题。
将 AI 注入 Java 应用程序
文章围绕将 AI 注入 Java 应用程序展开,以宇宙飞船租赁应用的聊天机器人为例,介绍如何用 LangChain4j 和 Quarkus 等 Java 框架与大语言模型(LLM)交互,还提及流式响应、结构化输出等功能及相关概念。