多模态生成」共找到 2919 篇相关文章

产品应用8

腾讯AngelSlim重磅升级!面向全模态的大模型压缩算法工具包,推理速度飙升 1.8倍!

近年来,推理阶段的成本等因素制约大模型规模化应用。腾讯混元升级的 AngelSlim 围绕 Eagle3 投机采样训练范式构建系统化实现,支持多模态场景,最高可实现 1.9× 推理加速,还具备多亮点。

腾讯技术工程
开源动态8

空间智能终极挑战MMSI-Video-Bench来了,顶级大模型全军覆没

上海人工智能实验室 InternRobotics 团队推出空间智能视频基准 MMSI-Video-Bench,对主流多模态大模型进行评测。该基准题型全面、问题具挑战性,视频数据多样,能针对性测评。结果显示模型与人类差距显著,明确了能力瓶颈。

机器之心
推荐文章8

AI热点选品:当推荐系统遇上“热点”,我们需要一场变革

文章指出当下推荐系统追踪热点滞后,存在时效、解码、迭代困境。为此启动热点AI选品项目,构建自动化热点响应系统,经多环节处理输出优质候选集,还介绍成果、后续优化方向及AIGC图像生成方案。

阿里云开发者
算法论文8

大模型如何准确读懂图表?微软亚研院教它“看、动手、推理”

多模态大模型处理结构化图像有误差放大、推理难等问题。微软亚洲研究院等提出PixelCraft,以高保真图像处理与非线性多智能体推理为支柱,提升结构化图像理解性能,在多基准上有增益。

量子位
新闻资讯8

29个月增长100倍:一个AI 2.0公司应该怎么建?HeyGen的取胜的秘密

AI视频生成公司HeyGen在29个月内ARR从100万美元增长到超1亿美元。创始人Joshua Xu公开取胜秘密,即独特运营模式‘The HeyGen Way’,包括拥抱变化、匹配节奏、最小化快速验证迭代等理念。

AI工程化
算法论文8

GPT-6 或有"生命"!MIT新作实现LLM自我进化,冻结权重时代终结

MIT新作《Self-Adapting Language Models》实现LLM自我进化,SEAL框架让模型自己生成“自编辑”微调自身。它能实时学新数据、修复知识、形成记忆。经两种场景验证,小模型也能超越GPT - 4.1等。

PaperAgent
新闻资讯7

更长的推理链反而导致更多幻觉,MLLMs 幻觉解法仅「抄作业」还不够?摘要

近日,斯坦福等校学者发现,更长推理链会让 MLLMs 产生更强幻觉。MLLMs 幻觉不仅涉及语言偏差,还有跨模态语义失配。主流多模态架构在结构设计和训练机制上的潜在失衡,是幻觉频发的主因。

机器之心
算法论文7

“看懂”指令并做动作!Motion-R1结合COT让角色动起来

大语言模型为文本驱动动作生成带来新可能,但现有方法有局限。GigaAI提出Motion - R1框架,融合“思维链”机制,能分解指令、优化动作合成,虽有不足,但在测试中表现优于主流方法。

带你学AI
新闻资讯8

首批GPT-6内测结果好离谱啊。。。

GPT - 6使用资格分批开放,内测玩家抢先体验。其在3D生成、游戏开发、网页制作等多领域表现出色,如15分钟做出Mac应用,空间推理达世界级水平,但运行时Token消耗大。

量子位
产品应用8

Meshy用户破千万后杀向新战场:ARR年翻14倍,头部厂商集体买单

Meshy是计算机图形学大神胡渊鸣创立的AI 3D公司,其创意工坊打通“AI创意→实体交付”。Meshy生成模型打印适配度高,破圈至多元领域,注册用户破千万,ARR年翻14倍,获多轮融资。

量子位