多模型推理」共找到 9928 篇相关文章

产品应用8

顶级邪修再战 Nano Banana Pro ,超玩法,太猛了这玩意!

谷歌发布 Nano Banana Pro 模型,将图片模型能力推向顶峰,支持中文。它能生成准确视觉内容、语言文本,可混合元素,支持分辨率。经测试,其各方面表现出色,应用场景丰富,版权限制宽松,三方应用和谷歌官方均可使用。

歸藏的AI工具箱
开源动态7

OmniAvatar震撼开源!阿里夸克开源全新音频驱动角色模型

音频驱动人体动画技术有局限,阿里夸克团队推出OmniAvatar模型。它用逐像素层次音频嵌入和LoRA训练法,解决唇动同步等问题,适用于领域,但也存在颜色偏移等不足。

带你学AI
新闻资讯7

MMAR与AudioTrust技术解读,音频大模型评测前沿进展分享 | AI Bench Talk直播预告

司南评测集社区 CompassHub 收录维度评测集。此次 AI Bench Talk 直播聚焦音频大模型,将分享评估其深度推理能力的 MMAR 及全方位可信评估框架 AudioTrust,还设圆桌讨论模态/音频大模型相关议题。

OpenMMLab
算法论文8

视频扩散模型新突破!清华腾讯联合实现高保真3D生成,告别视图依赖

清华大学联合腾讯提出Scene Splatter,基于视频扩散模型,从动量视角引导其生成满足三维一致性的视频片段,提升三维场景生成效果,解决了传统方法在单张图片重建三维场景的难题。

量子位
开源动态8

刚刚,字节开源Seed-OSS-36B模型,512k上下文

深夜,字节跳动Seed团队开源Seed-OSS系列模型,含三个版本。其用12万亿tokens训练,在基准测试表现出色。有灵活推理预算控制等特性,原生支持512K上下文窗口,基准测试成绩佳。

机器之心
开源动态8

社区供稿丨如何抑制大模型的“过度反思”:Yuan3.0 Flash 中的强化学习范式

模型在企业落地时存在“过度反思”问题,浪费算力。YuanLab.ai团队在Yuan3.0 Flash模型中提出RIRM与RAPO,前者奖励“思考过程”,后者优化训练框架,实现推理效率提升,适用于企业场景。

Hugging Face
开源动态8

通义实验室正式开源 Mobile-Agent v3.5 及新一代平台 GUI Agent 基座模型 GUI-Owl-1.5

通义实验室正式开源 Mobile - Agent v3.5 及新一代平台 GUI Agent 基座模型 GUI - Owl - 1.5。该模型档参数可选,分 Instruct 和 Thinking 版,支持平台。它解决了高质量数据难搞定等痛点,评测表现良好。

深度学习自然语言处理
开源动态7

最大游戏up主也玩本地AI?让笔记本都能跑大模型的Parallax来了

11月3日,知名游戏博主PewDiePie展示自建本地AI系统,引发全网轰动。本地AI有隐私、性能等优势。Parallax是开源AI项目,挑战“AI必须上云”逻辑,支持异构设备组网和模型,性能优。

机器之心
算法论文7

思维链推理是一种脆弱的‘海市蜃楼’,一旦超出训练分布,它便会消失。| 直播预约

思维链提示能提升LLM在任务上的表现,让人感觉模型在深思熟虑。但研究从数据分布角度剖析,发现思维链推理是脆弱的‘海市蜃楼’,超出训练分布就会消失,强调实现通用推理能力挑战大。

深度学习自然语言处理
算法论文8

模型汤新做法!Meta|提出“类别专家汤”:SoCE,大幅提升模型性能,刷新SoTA!

大语言模型领域,提升性能常需高算力、大量数据和长时间训练。Meta提出新型模型汤技术SoCE,通过分析类别相关性操纵模型权重,在BFCL上刷新SOTA记录,为开源社区指明低成本进化之路。

AINLPer