「UCSD研究团队」共找到 4698 篇相关文章
微软推出深度视频探索智能体,登顶多个长视频理解基准
尽管LLMs和VLMs在视频分析和长语境处理有进展,但处理数小时长视频有局限。微软提出智能体Deep Video Discovery (DVD),以简洁框架在LVBench取得高准确率,将以MCP Server形式开源。
无需训练,即插即用,2倍GPU端到端推理加速——视频扩散模型加速方法DraftAttention
高质量视频生成任务中,扩散模型成主流,但DiT模型注意力机制计算量大,成推理瓶颈。现有加速法效果不佳,为此美国东北大学等团队提出DraftAttention,可2倍加速推理且不损画质。
GitHub 1.3k 一款能“填色回忆”的神器:DDColor 让老照片鲜活又逼真
DDColor是阿里达摩院团队提出的新一代图像自动着色模型,基于双重设计,能实现高保真、真实感强的黑白图转彩色图。它兼容多种类型图片,有诸多核心功能,相比传统模型优势明显,应用场景广泛。
10% KV Cache实现无损数学推理!这个开源方法解决推理大模型「记忆过载」难题
推理大模型推理时易现冗余问题,R-KV开源方法登场,显存降90%、吞吐提6.6倍、准确率达100%。它通过实时对token排序解决冗余,还经多步骤压缩KV缓存,性能测试表现出色,适用多场景。
40岁开始预防衰老最有效!1.9万人脑扫描揭秘:大脑衰老有“关键窗口期”
一项发表于《美国国家科学院院刊》的研究,分析超1.9万人功能性磁共振成像,发现大脑衰老非线性,与胰岛素抵抗增加相关。还发现酮体可绕过胰岛素抵抗供能,40 - 59岁干预效果最佳。
21.7K 标星的开源TTS!FishAudio开源情感语音核弹:200万小时炼成“声优AI”!
FishAudio团队推出新一代TTS语音模型OpenAudio S1,基于200万小时音频数据训练,采用Qwen3+Descript Audio Codec架构。它能实现情感表达,在TTS - Arena榜单登顶,还提供不同版本适配,适用场景广泛。
AGI真方向?谷歌证明:智能体在自研世界模型,世界模型is all You Need
谷歌DeepMind研究人员表明,通用AI智能体处理复杂长期任务需学习内部世界模型,还证明可从智能体策略提取该模型。此研究成果补充多领域,对AI发展和安全意义重大。
陶哲轩转发!DeepMind开源「AI数学证明标准习题集」
DeepMind开源形式化数学猜想库,收录经典数学猜想,还提供代码函数方便形式化表述。此库可作测试基准提升AI数学推理能力,是AI+ATP范式关键前置步骤,团队邀更多人参与丰富内容。
微信自研高性能推理计算引擎 XNet-DNN:跨平台 GPU 部署大语言模型及优化实践
本文深入解析微信自研的高性能推理计算引擎 XNet-DNN,介绍其核心技术架构和性能优化策略。该引擎基于 RCI 框架构建跨平台 GPU LLM 推理能力,在多方面超越现有解决方案,还给出了详实对比实验数据。
LLM省钱大测评!48块GH200,首个百亿级参数量实证
EfficientLLM项目聚焦LLM效率,提出三轴分类法和六大指标,实验覆盖多方面。研究表明效率优化需权衡,最优策略因任务和模型规模而异,且相关技术可迁移到跨模态模型,成果将开源。