视频大模型」共找到 9464 篇相关文章

开源动态7

香港科技学、Manycor开源空间模型,超3000颗星

香港科技学、Manycore联合开源空间模型SpatialLM,用于处理3D点云数据。它结合点云特征提取、对齐和语言生成,实现高效转换。研究团队经多种尝试选定基于点的方法及Sonata编码器,还选Qwen2.5 - 0.5B为基础模型

AIGC开放社区
技术实践8

RTP-LLM 在相关性模型中的推理优化最佳实践

淘宝搜索场景引入参数LLM模型,面临系统性能挑战。本文分享基于RTP - LLM框架的优化实践,如BatchSize调度、批次内前缀复用、MoE Kernel动态调优等,还提及未来优化方向。

阿里云开发者
算法论文7

利用模型检测钓鱼邮件:方法,效果及数据集

随着企业安全防范增强,钓鱼邮件成重要攻击手段,模型检测方法盛行。日本论文详细披露检测方法和实验数据,含解析解码、简化邮件、生成prompt、调用LLM四步,还介绍数据集及评估了四个模型效果。

AI与安全
算法论文8

挤干模型高分「水分」!最强模型仅49分,南傅朝友发布Video-MME-v2

南京学傅朝友团队在 Google Gemini 评测团队邀约下推出视频理解新基准 Video-MME-v2。它有创新的分层能力体系与组级非线性评分,揭示模型与人类的巨鸿沟、传统 Acc 指标虚高、“Thinking”并非总是增益等现象。

机器之心
算法论文8

Tool-Star:赋予模型结合多工具推理的能力

文章提出Tool - Star框架,旨在解决模型多工具协作推理难题。它从数据端到训练流程优化,让模型调用多种工具,在复杂计算和知识型推理任务表现卓越,还探讨了未来多模态及多工具扩展方向。

PaperAgent
算法论文8

首个可学习姿态对齐的视频扩散模型!StableAnimator++

当前人像动画扩散模型在人物身份一致性上表现不佳,复旦学联合多团队提出StableAnimator++,它是首个可学习姿态对齐的视频扩散模型,能生成自然保真的人物动画,还在保持人脸一致性上做了改进。

带你学AI
算法论文8

The Batch:841 | 语言模型正在纠正历史遗留的不公

美国北加州旧不动产契约含种族歧视条款,虽已非法但人工筛查耗时久。斯坦福和普林斯顿研究团队微调语言模型识别圣克拉拉县契约中的歧视条款,模型可理解上下文,结果经律师确认,研究成果已开源。

DeeplearningAI
推荐文章7

模型的第一性原理:(二)信号处理篇

本文从信号处理角度解读模型原论文,探讨语义向量化原理,分析 Transformer 与 Granger 因果关系。指出模型输入 Token 语义嵌入是将自然语言处理转化为信号处理问题,向量化与信号处理、信息论联系紧密。

机器之心
算法论文7

重塑你的vlog!PickStyle打造稳定的视频风格迁移模型

Pickford提出PickStyle,这是基于扩散模型视频视频风格迁移框架。它结合上下文–风格适配器和CS–CFG机制,能在保持画面连贯时准确迁移风格,还能避免闪烁等问题,不过也继承了基础模型部分缺陷。

带你学AI
开源动态8

智谱联合清华开源多图参考视频生成模型,带来主体一致性新高度

合肥工业学、清华学和智谱开源多主体参考视频生成模型Kaleido。它用全新数据构建法和精巧架构,解决主角与背景混淆难题,实验显示其在多维度表现优异,超越现有开源模型

AIGC开放社区