模长感知」共找到 955 篇相关文章

算法论文8

Meta超级智能实验室首篇论文:重新定义RAG

Meta超级智能实验室首篇论文提出REFRAG框架,重新定义RAG。它通过“压缩、感知、扩展”流程优化LLM处理外部知识方式,最高将首字生成延迟加速30倍,且性能无损。

量子位
开源动态8

态开发革命!Gabber开源:图形化构建实时AI应用,效率提升10倍!

AI应用迈向多态交互,传统开发方式周期。开源项目Gabber是实时AI应用引擎,通过块化与图形化简化开发,有诸多特性,还给出安装指南,适用于多种场景。

开源星探
算法论文8

OmniHuman-1.5:让数字人拥有“思考”的视频生成新范式

现有视频数字人型难捕捉角色本质,字节提出 OmniHuman - 1.5 框架。其核心创新是用 MLLM 提供语义引导、提出多态 DiT 架构和伪末帧设计,使型融合多态信号,生成高质量角色动画。

带你学AI
产品应用7

八爪鱼微电子:打造感算一体的智能识别生态

八爪鱼微电子成立于2019年,是国内智能门锁芯片与组领域领先企业。它构建‘感算一体’底层技术体系,还通过标准共建、创新平台构建等推进生态建设,欲以技术与生态驱动行业创新。

芯师爷
算法论文7

清华-腾讯联手:音频 - 视觉多态任务统一框架

Crab是人大、清华和腾讯合作论文提出的型,目标是高效一统多态场景理解任务。它解决了音频 - 视觉理解型任务干扰、合作显式化不足等难点,通过构建数据集、设计结构和统一架构实现多任务合作。

CourseAI
推荐文章8

深度解读《AI 智能体的上下文工程》:构建高效 Agent 的七个宝贵教训

作者解读 Manus 团队文章,结合自身理解总结出构建高效 Agent 的 7 个关键点,如依赖上下文工程、提升 Prompt 缓存命中率等,还给出总结与核心启示,对 Agent 开发有借鉴意义。

宝玉AI
开源动态7

OmniAvatar震撼开源!阿里夸克开源全新音频驱动角色

音频驱动人体动画技术有局限,阿里夸克团队推出OmniAvatar型。它用逐像素多层次音频嵌入和LoRA训练法,解决唇动同步等问题,适用于多领域,但也存在颜色偏移等不足。

带你学AI
产品应用7

这个周末,很多人都在等一个额度重置,以及对 Work 式的吐槽

ChatGPT Work 式上线后,Token 消耗快,用户等额度重置。该式与 Codex 易混淆,前者处理通用知识类任务,后者面向软件开发。国内外产品纷纷推 Work 式,未来或融合。

MacTalk
推荐文章7

Anthropic说:Session Management 是最好用的 Harness Engineering!

Anthropic指出管理Session、Context等在Claude Code上已落地。型上下文并非越越好,rewind比纠错好,compact要把握时机,subagent可隔离上下文,如今行业看重agent产品runtime。

探索AGI
算法论文8

视频生成不再「断片」:OneStory给型装上「选择性记忆」,跨镜头讲故事人物场景始终如一丨CVPR'26

多镜头视频生成挑战大,现有方法有局限。Meta与哥本哈根大学研究者提出OneStory,为多镜头视频生成建立跨镜头记忆机制,可生成连贯视频,在复杂叙事中保持一致。

量子位