「多模态基础模型」共找到 8091 篇相关文章
一家营收千亿美元的公司,如何回应 AI 落地的策略问题
2025年9月19日,Qwen3和DeepSeek v3.1上线Amazon Bedrock。该产品秉持“Choice Matters”理念,为不同业务选适配基础模型,上架超二百余款模型。亚马逊云科技副总裁总结选模型要点,其策略影响AI落地进程。
AI圈水太深:OpenAI保密、Meta作弊!国产MoE却异军突起
文章梳理大语言模型发展,从传统稠密架构到稀疏MoE架构,参数从百亿到万亿。介绍OpenAI、Meta等厂商模型,如GPT系列、Llama系列,还提及Mixtral、DeepSeek V3等。指出Meta作弊丑闻,国产MoE模型异军突起。
Sora 2瑟瑟发抖!通义万相2.5放大招:一句话出1080P电影,音画精准同步
云栖大会上通义万相2.5系列模型亮相,包含四大模型,视频生成模型实现音画同步突破,降低电影级视频创作门槛。它创作能力全方位升级,支持多种模态输入,采用原生多模态架构。
Kimi K2里找到了DeepSeek V3架构
Kimi新模型K2热度高,在多benchmark上达SOTA,网友好评多。Kimi工程师透露K2开源原因,还谈及Kimi发展策略。实测显示K2在前端制作、工具调用、创意写作上表现出色。此外,OpenAI开源模型推迟,引发猜测。
大语言模型逻辑评估
现有归因问答评估方法有‘归因短视’问题,研究团队提出 LOGICSCORE 框架,从三维度量化推理质量。在多数据集测试多款 LLM,发现专有、开源模型等存在不同逻辑问题,还分析典型逻辑错误。
基于 Qwen3-VL-Embedding-8B 实现文搜图语义内容检索的实战教程
文章围绕Qwen3-VL-Embedding-8B模型展开,介绍其核心特性、技术架构等,提供环境搭建、模型部署指南,给出文搜图系统架构及代码实现,还通过电商、社交媒体、企业文档三个实战案例展示应用,最后讲解性能优化与常见问题解决方法。
李飞飞发布全新世界模型
李飞飞团队的World Labs发布两款新模型Marble 1.1和Marble 1.1 - Plus,能将平面照片转化为3D世界、提升画面清晰度。二者各有侧重,前者重画质优化,后者重空间生成,官方建议新用户从1.1开始用。
扩散语言模型九倍推理加速!上海交大:KV Cache并非自回归模型的专属技巧
上海交通大学EPIC Lab团队提出免训练推理缓存机制dLLM - Cache,复用特征降低计算量。它即插即用,通用于主流dLLM架构,在多个基准测试中实现数倍推理加速,且不降低生成质量。
国产模型开源封神,谷歌Genie3紧急开源?蚂蚁AGI撕开世界模型闭源防线
蚂蚁灵波发布开源SOTA级世界模型LingBot - World,全面对标谷歌Genie 3,部分性能指标超越。它有高保真、长视频生成等优势,还能解决具身智能痛点,发布后引发海外关注,促使Genie将开源。
宇树:开源机器人世界大模型!
宇树开源世界模型 - 动作架构UnifoLM - WMA - 0,它属UnifoLM系列,适配多机器人本体。真机部署表现出色,预测与实际操作吻合。官方介绍训练策略,代码开源后GitHub获100 + Star。