通用视觉推理」共找到 3106 篇相关文章

开源动态8

告别「面瘫」配音,InfiniteTalk开启从口型同步到全身表达新范式

传统video dubbing技术有局限,新兴模型也有问题。美团视觉智能部研发的InfiniteTalk引入‘稀疏帧video dubbing’,实现口型、表情、肢体与音频自然对齐,解决长视频生成难题,技术已开源。

机器之心
推荐文章7

R1时代,RAG-Retrieval技术总结与展望~

RAG - Retrieval提供全链路RAG检索模型微调、推理及蒸馏代码,支持多模型、多loss和训练方式。还发布模型技术报告,设计评估框架,未来探索RL在检索领域应用。

PaperAgent
算法论文8

Transformer祖传设计遭暴击,COLM顶会三篇论文发难

COLM 2026上,三篇论文对Transformer关键技术发难。《Cracks in the Foundation》指出长上下文架构选择影响大;《Lost in Backpropagation》揭示输出投影层信息损耗严重;《When Fewer Layers Break More Chains》表明层剪枝影响长链推理

量子位
产品应用7

Claude Code 作者:别再沉迷功能堆砌了!最好的 AI 工具,是把控制权还给你

Claude Code 创造者 Boris Cherny 提出“极简主义哲学”,认为最好的 AI 工具应是简单、通用、无偏见的“乐高积木”,把控制权还给用户。还回顾编程发展,介绍开发体验进化及 Claude Code 工作流。

AI科技大本营
开源动态7

美团开源Agentic新王,速度拉满,工具调用打爆Kimi?

周末美团开源LongCat - Flash大模型,参数量560B,推理速度达100 token/s,成本低,在Agent工具调用表现超Kimi - K2。它有Zero - Computation Experts和ScMoE创新,不过市场表现未获太多认可。

探索AGI
算法论文8

腾讯混元TurboS技术报告首次全公开:560B参数混合Mamba架构,自适应长短链融合

腾讯公开混元TurboS技术报告,该模型是超大型Hybrid Transformer - Mamba架构MoE模型,融合Mamba与Transformer架构优势,有自适应长短思维链机制,激活参数56B。在多评测中表现佳,推理成本低。

AI前线
新闻资讯7

Karpathy刚进Anthropic,转头又投了它

AI初创公司Engram成立8个月,估值达6亿美金,获9800万美元融资。它聚焦AI记忆,用Cartridges技术降内存、提速度,将推理和记忆层拆开,团队成员背景强大,押注AI范式新转向。

新智元
算法论文8

14.7M参数,小目标AP达到13.9%!FSDETR用频空融合重新定义目标检测

传统小目标检测问题多,2026年4月FSDETR论文提出频空融合法,用14.7M参数获13.9% APS成绩。它有SHAB、DA - AIFI、FSFPN三个核心模块,还给出训练、推理及导出ONNX部署代码。

机器学习AI算法工程
推荐文章8

藏师傅开发的 Codepilot 保姆级入门攻略

本文是藏师傅开发的 Codepilot 全平台通用开源 Agent 客户端的保姆级入门攻略,介绍了其特色功能,涵盖安装、配置服务商、聊天、技能使用等方面,助读者快速上手。

歸藏的AI工具箱
算法论文8

告别噪声初始化:NTU MARS Lab提出A2A新范式,实现机器人高性能单步动作生成

新加坡南洋理工大学 MARS Lab 提出 Action-to-Action (A2A) Flow Matching 新范式,以历史机器人轨迹为生成起点,打破生成速度与精度瓶颈,在训练效率、推理速度及泛化表现上佳,还可扩展至视频生成领域。

机器之心