模态代沟」共找到 167 篇相关文章

产品应用8

当具身智能遇到“大脑”瓶颈,一家国家队公司决定拆掉围墙共筑基石|甲子光年

2月28日“启智涌现”开发者大会举行,启智机器人试图解决行业软硬件耦合深等矛盾。它打造通用技术底座,用大衍数据平台等构建技能进化引擎,还以新商业模式构建生态飞轮,推动机器人融入各行业。

甲子光年
新闻资讯8

《多模态大语言模型技术发展报告》正式发布 | 中科算网算泥社区

2月5日,中科算网算泥社区发布《多模态大语言模型技术发展报告》。报告回顾多模态大模型发展历程,剖析核心技术创新,展示应用实践,分析挑战与机遇,为各界提供参考,推动多模态AI技术发展。

AIGC开放社区
新闻资讯8

震撼全网!3位00后夺200万大奖,卷走鹅厂顶级Offer

历经四个月,「腾讯广告算法大赛」战果揭晓,「Echoch」战队夺冠,另有两支战队杀入三甲,前十名全员获鹅厂Offer意向书。赛事揭示推荐系统正迈入「端到端生成」新纪元,各战队方案亮点多。

新智元
产品应用8

字节Lynx:从单张图像生成高保真个性化视频

字节推出高保真个性化视频生成框架Lynx,基于开源的Diffusion Transformer,引入ID - adapter和Ref - adapter,在基准数据集表现优异,能平衡身份保真度等,还可拓展至多模态和多主体。

带你学AI
算法论文8

UofT、UBC、MIT和复旦等联合发布:扩散模型驱动的异常检测与生成全面综述

多伦多大学、麻省理工学院等高校研究者合作完成长文综述,聚焦扩散模型在异常检测与生成领域的应用,梳理图像、视频等异常检测任务进展,提供分类体系,展望未来趋势。

机器之心
开源动态8

模态Qwen3-VL-Embedding开源&技术剖析

互联网内容多元,传统文本搜索引擎应对跨模态需求力不从心。阿里开源Qwen3-VL系列两大模型,Qwen3-VL-Embedding负责“海选”,Qwen3-VL-Reranker负责“决赛”,技术亮点多,实验表现优异。

PaperAgent
开源动态7

超越ZIP的无损压缩来了!华盛顿大学让大模型成为无损文本压缩器

华盛顿大学SyFI实验室提出LLMc,利用大型语言模型进行无损文本压缩。基准测试显示其压缩率优于传统工具,且项目已开源。不过,当前版本存在效率、吞吐量等问题,应用范围也主要在自然语言。

量子位
算法论文8

音频大模型安全可信度的全面“体检”!6大维度,清华南洋理工联手打造

南洋理工和清华团队提出新框架AudioTrust,将ALLMs评估扩至六个核心维度,探究音频模态特有问题。目前基准及平台已开发,揭示了开源与闭源ALLMs在多维度的潜在风险。

量子位
产品应用7

这样更公平:用jina-reranker-m0为多模态文档打分重排

文章指出多模态搜索领域给文档综合评分难,因文本与图像评分缺乏可比性。2025年4月发布的jina - reranker - m0可解决此问题,其两阶段检索流程能显著提升召回率,对多模态AI系统设计有启发。

Jina AI
新闻资讯8

阿里云海外重磅发布 Qwen Cloud

5月26日,阿里云在新加坡面向全球发布Qwen Cloud。它为AI Agent而生,有Skills、CLI、Website三入口架构,一站式接入模型,覆盖六大模态,成本可控,开放多元生态,还启动黑客松活动。

阿里云开发者