视频流优化」共找到 2258 篇相关文章

算法论文8

AI玩拼图游戏暴涨视觉理解力,告别文本中心训练,无需标注的多模态大模型后训练范式

在多模态大模型后训练浪潮中,现有方法多以文本为中心。MMLab@南洋理工大学提出Visual Jigsaw,将拼图任务用于后训练,让模型不依赖标注强化视觉感知与理解,在图片、视频和3D模态验证有效。

量子位
算法论文8

Google研究发现:Multi-Agent的核心竟然是Prompt设计!

Google和剑桥大学研究多智能体系统,发现提示设计影响大,有效拓扑结构占比小。提出Mass框架分三阶段优化,实验用Gemini 1.5 Pro和Flash模型,对比多种方法,在多任务上性能显著提升。

PaperAgent
推荐文章7

别学提示词,学逻辑

作者黄益贺认为别学提示词、别买相关课程,因其本质是通用沟通技巧,靠逻辑和方法论。还提到提示词上层是针对模型优化,但普通用户做好底层就行,靠提示词收割量挺无聊。

newtype AI
算法论文8

千万级标注成本归零!CVPR 2025清华团队成果:相机的“自运动”就是最好的老师

以往空间音频模型受限于采集条件和标注成本,清华和密西根大学团队在CVPR 2025给出新路径,利用相机自运动作监督信号,让模型从互联网视频学三维空间音频感知,成果入选会议Highlight。

量子位
开源动态7

开源一个非常漂亮的文章配图 Skill

作者将给文章配图的经验做成 `guizang-material-illustration` Skill 开源。它能把文章等内容变成带中文标签解释图,适配多种场景,解决配图难题,还做了多项优化,介绍了适用场景、安装使用方法。

歸藏的AI工具箱
产品应用8

懂方言,通诗词,精通30国语言,阿里发布语音识别大模型Fun-ASR1.5

阿里发布语音识别大模型Fun - ASR1.5,可精准识别30种语言,覆盖中文七大方言体系及二十余种地方口音,强化古诗词诵读专项识别,后处理环节优化标点预测和文本归一化,降低人工成本。

千问大模型
产品应用8

Claude Code迎来大更新:Agent能力增强

Claude Code 2.1.0正式发布,围绕Agent能力、开发者体验和安全性全面升级。有大量功能新增,如技能与Agent的热重载、上下文分叉等;修复诸多问题,还进行了性能、可靠性等方面的优化

AI寒武纪
算法论文8

一张照片,一个3D「你」:计算所等提出HumanLift,实现高保真数字人重建

中国科学院计算技术研究所等机构研究人员提出 HumanLift 技术,基于单张参考图像重建高斯网数字人全身。该技术融合三维视频扩散模型和人脸增强,仅需单张人体图片就能重建高逼真三维数字人。

机器之心
算法论文7

Thinking Machines再发文:模块化形让训练更稳定

Mira Murati团队分享神经网络训练推理新研究,提出“模块化形”让训练更稳定。将权重约束在Stiefel形,设计Manifold Muon优化器,实验显示效果好,但计算开销和理论问题待解决,代码已开源。

AI工程化
产品应用8

训练MoE足足提速70%!华为只用了3招

Scaling Law下,MoE成扩展模型能力法宝,但训练难题凸显。华为构建Adaptive Pipe & EDPB优化方案,还打造DeployMind仿真平台,解决了MoE训练中通信等待、负载不均等问题,使训练吞吐提升72.6%。

量子位