「多模态数据」共找到 3187 篇相关文章
12ms!一个仅8M的语音停顿检测模型
语音助手准确判断用户是否说完是挑战,Smart Turn将决策过程缩至12毫秒。其v3.1版有改进,新增数据集提升英语识别准确率,推出未量化版本推理更快,8MB模型性能优,已在HuggingFace开源。
PolarDB Supabase 助力 Qoder、Cursor、Bolt.diy 完成 VibeCoding 最后一公里
Vibecoding是开发者追寻的理想境界,但常被各种‘摩擦力’打断。PolarDB Supabase提供‘零摩擦’后端基础,通过MCP Server填平前后端断层,还能与Qoder、bolt.diy集成,提升开发效率,文末介绍其构建图数据分析应用方案。
AI们数不清六根手指,这事没那么简单。
作者测试发现Grok4、OpenAI o3等多模态模型都将六指图数成五指,仅Claude 4偶尔答对。研究揭示大模型看图片用记忆而非视觉,易受刻板印象影响,在工业等场景或引发严重后果。
“甲方快乐模型”诞生,拿下平面设计新SOTA!多条件一键生成,还能独立调整元素 | 复旦&字节
复旦大学和字节跳动团队联合提出CreatiDesign新模型,可实现高精度、多模态、可编辑的AI图形设计生成。它解决了以往方法在处理图形设计时的难题,在多维度评估基准上表现出色,还支持多轮编辑。
错过它=落伍!只用一张照片+14秒,腾讯开源 HunyuanVideo-Avatar 带你玩转多角色数字人
HunyuanVideo-Avatar 是腾讯混元团队最新开放的多模态数字人生成模型。上传一张人物图片,再配上一段音频,模型即可在约 14 秒内输出分辨率最高 720p、情绪可控、动作丰富且支持多角色同屏的短视频。
4000 万美金新一轮融资,ACE 成为 AI 音乐赛道融资额最高的华人团队
近日,AI音乐公司ACE完成近4000万美元新一轮融资,成AI音乐赛道融资额最高的华人团队。它自己训练音乐基础模型与做应用,构建数据飞轮,还推出新消费级产品Miya,欲打造AI时代的Spotify。
复盘高德扫街榜100天
2026年1月7日,高德发布“高德扫街榜2026”新版本,有三大升级。上线百日成绩亮眼,累计用户超6.6亿。它在异地场景优势明显,还打出“行为数据”王牌,从多层面解决信任问题,推出飞行街景等功能。
谷歌黑魔法,没人能看懂的Gemini 3 Flash
Gemini 3 Flash速度快3倍且智力超Pro,但没人明白其更「聪明」的原因。它打破「参数即正义」逻辑,在多项测试领先。谷歌或靠TPU、算法、数据优化,还可能用了Titans架构,有重大战略意义。
1100多个模型殊途同归,指向一个「通用子空间」,柏拉图又赢一回?
约翰斯・霍普金斯大学研究发现,1100多个不同神经网络,即便训练条件不同,最终权重会收敛到共享低维子空间,表明架构比数据影响大。此发现能解释诸多现象,还有多种应用可能,但也有局限性。
8B硬刚72B!MiniCPM-V 4.5技术报告正式出炉
行业首个具备“高刷”视频理解能力的多模态模型MiniCPM-V 4.5技术报告发布,提出三项关键技术,使模型在多任务达同级SOTA,8B参数规模超72B模型,推理快,开源后获社区好评。