视频大模型」共找到 9616 篇相关文章

算法论文8

天下武功,唯快不破:LLM高效架构最新最全面综述

型语言模型虽成就辉煌,但训练成本高、推理延迟,核心问题源于Transformer架构。这篇综述论文首次系统性梳理高效LLM架构创新方案,分类七类方法,延伸至跨模态应用,为研究者提供‘效率蓝图’。

深度学习自然语言处理
新闻资讯7

微软叫停Tokenmaxxing!预算卡死,超限自负

从今年7月起,微软为各业务部门设「AI Token预算目标」,将GPT - 5.6设为内部默认模型。此前Tokenmaxxing风靡硅谷,如今厂纷纷收紧AI使用,微软是最后跟进者之一。

量子位
开源动态8

The Batch: 855 | 为智能体而生

总部位于北京的 Moonshot AI 发布 1 万亿参数的 Kimi K2 系列语言模型,包括预训练和微调版本。它输入输出能力强,架构独特,在多基准测试领先,支持工具调用,多家服务商已集成。

DeeplearningAI
算法论文8

充分激发模态协作,MokA量身打造MLLM微调新范式

当下多模态模型微调多「照搬」单模态微调策略,忽视模态差异。中国人民学和上海人工智能实验室团队提出 MokA 方法,兼顾单模态与跨模态建模,在多基座、多场景实验中显著提升性能。

机器之心
产品应用7

让小爱音箱超越「指令-响应」模式,开启真正智能交互新时代

2017年智能音箱诞生,却被困于「指令 - 响应」模式。此次Open - XiaoAI进化,接管小爱音箱“耳朵”和“嘴巴”,通过多模态模型和AI Agent释放其潜力,还给出项目运行教程等。

GitHubStore
产品应用7

AI又来带货了!字节推出DreamActor-H1自动对齐手势和商品

在电商和数字营销领域,现有框架呈现效果不佳。字节推出DreamActor - H1框架,基于扩散变换器,集成Seaweed - 7B模型,能生成高保真人机交互视频,有效果突破但也存在局限。

带你学AI
算法论文8

一张照片,一个3D「你」:计算所等提出HumanLift,实现高保真数字人重建

中国科学院计算技术研究所等机构研究人员提出 HumanLift 技术,基于单张参考图像重建高斯网数字人全身。该技术融合三维视频扩散模型和人脸增强,仅需单张人体图片就能重建高逼真三维数字人。

机器之心
产品应用7

秒级集群翻转、分钟级IDC故障止损 | 同程规模Elasticsearch平台架构设计与实践

在数据驱动时代,同程旅行核心业务依赖Elasticsearch,随着集群规模扩,面临对用户、运维、平台要求高的挑战。本文分享同程ES平台架构设计、解决方案与实践成果,还展望借助模型提升智能化水平。

InfoQ
产品应用7

AI开始学会合作?!实测4多Agent体=10个打工人

Agent热潮进入多智能体时代,多款产品涌现。鲸哥测评了它们在商业计划、运营设计等四场景表现,总结各产品亮点与不足,指出多Agent正推动模型向“协作式智能群体”演进。

鲸选AI
新闻资讯7

5Y News|「自然选择」完成3000万美元融资

AI陪伴公司「自然选择」完成超3000万美元融资,由多家机构联合投资。其推出的《EVE》呈现全新AI陪伴产品形态,从五维度重新定义“AI陪伴”,还发布情感模型Echo - N1等。

五源资本 5Y Capital