超长文本生成」共找到 2541 篇相关文章

开源动态8

0.5B以小搏大拿下端侧模型新SOTA:4090可跑,长文本处理5倍常规加速丨清华&面壁开源

清华大学和面壁智能团队开源MiniCPM 4,有8B、0.5B两种参数规模,以22%训练开销达同级别最优。它在架构、推理、数据、训练多方面创新,性能领先,适用于综述生成、工具调用等场景。

量子位
产品应用8

多模态AI黑马刷榜后再造神器:一个产品搞定图片视频播客生成,自带百种特效,大牛梅涛团队出品

AI大牛梅涛创立的智象未来公司推出vivago2.0(智小象AI),支持图片、视频、播客生成,有上百种特效模板,生图还能自动优化prompt。其依托HiDream - A1,结合HiDream - I1和HiDream - E1能力,团队技术实力强且融资顺利。

量子位
新闻资讯7

微软亚洲研究院机器学习组首席研究员刘炜清确认出席 AICon 深圳,分享由生成式基础模型驱动的金融市场仿真引擎

8月22 - 23日,首届AICon全球人工智能开发与应用大会深圳站将启。微软亚洲研究院刘炜清等专家将分享经验。刘炜清会介绍由生成式基础模型驱动的金融市场仿真引擎MarS,展示其在金融场景潜力。

InfoQ
开源动态8

社区供稿 | Hugging Face x 北京中关村学院等机构联合发布生成式基因组大模型Carbon:一场关于“生命语言”的范式革命

北京中关村学院等联合发布生成式基因组大模型Carbon并开源。Carbon家族有三个版本,旗舰模型Carbon - 3B在多任务匹敌70亿参数的Evo2 - 7B,运行速度快275倍。它在数据、分词、训练上有创新,还实现技术普惠,有多种应用场景。

Hugging Face
算法论文8

生成视频总出物理bug?用VLM迁移+token级对齐,让燃烧在正确位置发生,碰撞遵循动量守恒丨CVPR 2026近满分接收

现有生成式视频模型多停留在“外观拟合”,未真正“物理建模”。中山大学等机构提出ProPhy,构建渐进式物理对齐框架,使模型有“分层物理理解”与“空间物理对齐”能力,论文被CVPR2026近满分接收。

量子位
算法论文8

AI生成视频总不符合物理规律?匹兹堡大学团队新作PhyT2V:不重训练模型也能让物理真实度狂飙2.3倍!

匹兹堡大学团队提出 PhyT2V 框架,论文已被 CVPR 2025 接收。该框架不依赖重训练或大量外部数据,通过链式推理与迭代修正机制,增强主流 T2V 模型物理场景泛化与生成能力,应用前景广。

机器之心
算法论文8

轻量高效,即插即用:Video-RAG为长视频理解带来新范式

现有视觉语言模型处理长视频面临诸多难题,厦门大学等联合提出轻量高效、无需微调的 Video-RAG 框架,采用多模态辅助文本检索增强生成,解决长视频理解问题,适用于多场景。

机器之心
产品应用8

DeepSeek-V4发布!高效百万上下文智能普惠时代来了

DeepSeek-V4发布,是开源社区关键分水岭。它解决超长文本处理效率痛点,架构与优化有多项突破,降低算力消耗和成本,适配国产芯片,性能比肩顶级闭源模型,推动开源社区两大未来趋势。

AIGC开放社区
算法论文8

不靠英伟达,中科院在国产 GPU 上跑通 76B 类脑大模型

过去大模型依赖Transformer和NVIDIA GPU体系,硬件自主化难。中科院团队提出类脑大模型SpikingBrain,在超长文本处理上百倍加速,在国产MetaX GPU平台稳定训练76B模型,开辟新道路。

AI科技评论
开源动态8

港大开源视频版RAG,像聊天一样看完百小时纪录片。

港大HKUDS团队开源超长视频理解框架VideoRAG,突破传统模型时长限制,支持对数百小时视频精准检索和问答。还有桌面应用Vimo,使用简单高效。介绍了其切片索引、混合检索、生成回答的实现逻辑。

开源AI项目落地