「视频语义搜索」共找到 1519 篇相关文章
工业级 LLM 数据工程:北京大学 DCAI 团队 DataFlow 框架的架构设计与实践
2026 年大模型研发从‘模型中心’向‘数据中心’演进,数据语义密度与工程精度成突破关键。北京大学 DCAI 团队推出 DataFlow 框架,解决数据准备难题,其技术报告登顶 Hugging Face。该框架有多种特性,实验验证其能提升模型性能。
北大大牛团队最新顶会,首次让AI能够生成真实火焰
北京大学陈宝权教授团队提出 FieryGS 框架,被 AI 顶会 ICLR 2026 接收。它将多模态大模型、燃烧物理仿真与 3D 高斯溅射融合,首次在 3D 重建中实现物理可信、语义感知且可控的火焰合成,推动数字孪生发展。
给Agent装上“海马体”!上海AILab开源MemVerse,定义多模态记忆新范式
上海人工智能实验室开源MemVerse,这是首个面向智能体的通用多模态记忆框架。它将多模态信息与文本对齐到统一语义空间,首创‘双通路’架构与‘记忆蒸馏’技术,让智能体有终身记忆能力,在多模态任务中表现出色。
Khosla 继 OpenAI 后的最大赌注,General Intuition 凭 38 亿个游戏高光片段做世界模型
今年10月,General Intuition完成1.34亿美元种子轮融资,由Vinod Khosla领投。它从Medal分拆,有38亿游戏短视频片段,可赋予机器“直觉和物理常识”,与LLM互补,商业化将从游戏拓展到物理世界。
英伟达新架构引爆全模态大模型革命,9B模型开源下载即破万
英伟达推出全模态大模型OmniVinci并开源,其90亿参数规模性能超同级别甚至更高级别模型,训练数据效率是对手6倍,能精准解析视频和音频,在多模态应用场景中表现卓越,下载量破万。
Suno V5让整个B站开始文艺复兴了。
文章指出B站鬼畜区曾没落,如今因Suno V5迎来文艺复兴。爆款AI音乐鬼畜频出,如漫游会议室的作品。介绍了用Suno V5创作歌曲及视频的方法,还强调鬼畜精神回归,小破站分享快乐的意义未变。
Andrej Karpathy 开炮:智能体都在装样子,强化学习很糟糕,AGI 十年也出不来
本周五,Andrej Karpathy 长达两小时多的采访视频引发关注。他直言行业步子迈得太大,嘲讽 AI 现状夸大、脱离实际。他认为智能体成熟需十年,强化学习糟糕,还探讨了 AGI、人类学习、教育未来等多方面问题。
用两个简单模块实现分割理解双重SOTA!华科大白翔团队等推出多模态新框架
华中科技大学和金山办公团队联合提出语义增强特征提取器(SEFE)和交错局部视觉耦合(ILVC)模块,构建多模态大模型LIRA,解决现有模型分割不精确和理解有幻觉问题,在分割和理解任务上达SOTA。
淘宝上卖9块9的DeepSeek,让我看到了被折叠的魔幻世界。
作者在淘宝搜DeepSeek,花9.9元下单号称无需部署、打开即用的产品,收到的却是360纳米搜索等免费链接。评论区全是好评,反映出信息鸿沟。AI本应打破壁垒,却成壁垒本身。
本周推荐的5个超级6的Github开源项目!
文章推荐了5个Github开源项目。如htmx,能在纯HTML搞定多种交互,无需JS;Flow.Launcher可快速搜索文件、启动应用;Maple Mono是编程字体,中英2:1对齐;Trilium Notes是分层笔记神器;Hyprnote可实时转录会议内容。