多模态视频推荐」共找到 2096 篇相关文章

产品应用7

更新啦!我用 Claude Skills 做的剪辑 Agent!识别效果+交互大升级

作者成峰根据用户反馈对剪辑 Skills 做了大改,替换火山引擎音视频识别模型、提升交互界面。改进包括用 API 替代本地模型、重构口误识别系统、设可视化审核界面,还介绍了简单使用方法。

AI产品自由
产品应用8

Gemini 3 Pro的位置,Kimi K2.5也想坐坐?

Kimi 发布 K2.5,在视觉编程上表现亮眼。它通过多模态训练涌现审美,能生成美观网页。与 Gemini 3.0 对比各有优势,Kimi Code 开源终端 Agent 功能强大,Kimi 还探索 Agent Swarm 协作新路径。

AGI Hunt
新闻资讯7

阶跃星辰豪揽超50亿融资,“天才创始人”印奇重掌帅印

阶跃星辰完成超50亿人民币B+轮融资,刷新近12个月中国大模型单笔融资纪录。同时印奇出任董事长。公司坚持“基础大模型”与“AI+终端”战略,在多模态领域成果多,正推进商业化探索。

InfoQ
算法论文8

从平面几何出发:形式化验证如何驱动MLLM的推理能力跃迁

多模态大语言模型在复杂数学与几何推理中有缺陷,现有训练方式让模型难有鲁棒推理能力。上海交大等团队提出“以形式化增强非形式化推理”方案,构建完整闭环,提升模型推理及泛化能力。

机器之心
新闻资讯8

陈天桥旗下盛大AI东京研究院于SIGGRAPH Asia正式亮相,揭晓数字人和世界模型成果

在SIGGRAPH Asia 2025期间,盛大AI东京研究院首次公开亮相。当前数字人交互缺乏“灵魂”,存在长期记忆与人格一致性、多模态情感表达缺失和缺乏自主进化能力等问题。为此,研究院推出Mio框架解决挑战。

机器之心
产品应用8

万相2.6 X千问APP,功能价值和情绪价值兼具|甲子光年

12月16日阿里发布视频生成模型“万相2.6”,实现“角色扮演”功能突破。千问APP接入后上线“AI小剧场”,打破次元壁。千问兼具功能与情绪价值,阿里全栈布局助力其成“超级入口”。

甲子光年
开源动态7

Wispr Flow 平替, 这款开源中文语音助手,程序员真该试试,本地离线的中文语音输入神器来了(开源白嫖版)

蛐蛐(QuQu)是开源桌面应用,用本地语音识别模型和配置的大语言模型,将语音实时转文字并润色。它主打本地语音工作流,替代Wispr Flow,免月费且保护隐私,适合中文用户。

小华同学ai
产品应用8

Macaron 新版本拆解:三个信号,看懂 Personal AI 的进化路径

Macaron新版本技术视频技术浓度超预期,结尾藏产品更新彩蛋。此次更新社交功能、Daily Spark、记忆打通等背后,藏着Personal AI关键变化,其团队Mind Lab有技术突破,开源方案获高认可。

特工宇宙
算法论文8

6款小游戏难倒所有顶级VLM!愤怒的小鸟让它们全军覆没,性能不如随机猜测

淘天集团未来生活实验室提出首个系统性评估多模态大模型(VLM)交互式物理推理能力的综合基准DeepPHY。它集成六个物理环境,对17个主流VLM测试,揭示其在物理交互等方面短板。

量子位
算法论文8

用「传心术」替代「对话」,清华大学联合无问芯穹、港中文等机构提出Cache-to-Cache模型通信新范式

随着大语言模型发展,多智能体系统中现有T2T交流方式有信息丢失、语义模糊、延迟大问题。清华等团队提出C2C信息传递方式,以KV - Cache为媒介,提升了正确率和速度,还介绍了实现路径、优势及应用前景。

机器之心