视觉语言预训练」共找到 3315 篇相关文章

开源动态8

美团杀入视频生成模型赛道,LongCat-Video 136亿参数媲美顶尖模型,效率提升10倍

美团LongCat团队发布LongCat - Video基础视频生成模型,有136亿参数量,多任务表现出色。它核心亮点多,还建立了数据处理流水线,采用特殊架构和训练方法,提升了生成效率,性能媲美顶尖模型。

AIGC开放社区
算法论文8

当 AI 下场炒 A 股,「推理」成了新的直觉

海外“AI Trading Battle”实验中,不同大模型交易表现差异大。港科大等团队提出RETuning方法,基于A股数据集验证,显著提升大模型金融预测准确率、推理可解释性,是综合改进方案,但有算力等局限。

AI科技评论
算法论文8

基于DINOv2和SAM2改进的U-Net模型

DSU-Net是基于DINOv2和SAM2改进的U-Net模型,通过多尺度跨模型特征协作和轻量级适配器模块,解决现有图像分割模型在特定下游任务表现不足问题,提升分割精度,降低训练成本。

机器学习AI算法工程
推荐文章8

《AI大模型时代老板必修课》

阿里云蒋林泉与钛媒体刘湘明在云栖大会展开《AI大模型时代老板必修课》对谈,围绕企业AI落地多方面关键议题交流。探讨了CIO角色进化、AI业务价值界定、企业战略制定等内容,为决策者提供实践指南。

阿里云开发者
算法论文8

Embedding黑箱成为历史!这个新框架让模型“先解释,再学Embedding”

来自多高校研究人员推出可解释的生成式Embedding框架GRACE,解决传统文本表征模型黑箱式表征瓶颈。它重新定义对比学习信号,含三个关键模块,训练双模式统一,实验跨任务提升且不损生成能力。

量子位
开源动态8

DeepSeek开源新模型,提出上下文光学压缩:LLM的新记忆方式

DeepSeek开源OCR模型,探索用多少视觉信息让LLM理解文本。实验表明1000字文档约需100个vision tokens,压缩比10倍、准确率97%。还提出模拟人类遗忘等想法,有多种应用场景,且完全开源。

花叔
算法论文8

Self-Forcing++:让自回归视频生成模型突破 4 分钟时长极限

加州大学洛杉矶分校与字节Seed等团队联合完成Self-Forcing++,让自回归视频生成模型突破4分钟时长极限。它解决传统模型架构缺陷,经三步技术实现稳定超长视频生成,实验超基线,但仍有长时记忆缺失等问题。

机器之心
算法论文8

首个多轮LLM Router问世, Router-R1可让大模型学会「思考–路由–聚合」

在大语言模型种类爆炸的时代,如何智能分配任务成新挑战。伊利诺伊大学香槟分校团队发布 Router - R1,让 LLM 学会‘思考–路由–聚合’,用强化学习平衡性能与成本,在七大基准测试表现出色。

机器之心
推荐文章8

万字长文 | 异构算力技术架构与核心组件解析

文章聚焦异构算力技术架构与核心组件,解析主流AI芯片特点、国产芯片技术路线;介绍高速互联技术、网络拓扑结构及优化方法;阐述大模型存储需求、分布式存储技术及数据预处理与加载技术,为AI计算提供全面方案。

AIGC开放社区
算法论文8

Meta「分割一切」3.0曝光!技能语义分割加入概念提示,好好玩,要爆了

Meta第三代“分割一切”模型SAM 3悄然投稿ICLR 2026。它支持基于概念提示的多实例分割,能听懂人话,处理图片快,还设计新架构、构建数据引擎、提出SA - Co基准,实验表现佳但也有局限。

量子位