模长感知」共找到 955 篇相关文章

新闻资讯8

Mamba-3惊现AI顶会ICLR 2026!CMU知名华人教授一作首代工作AI圈爆红

Transformer有力挑战者Mamba的最新版本Mamba-3进入ICLR 2026盲审。它有三大改进,在文本处理、实时推理和成本优化有优势。此外,FBAM也从不同角度探索Transformer下一代框架。

新智元
算法论文8

一键实现PPT演讲自由!「解说音频+视频」同步生成,效果逼近真人

澳大利亚与英国研究人员提出文档到演示视频生成任务,推出PresentAgent系统。它能将文档转为带语音和同步幻灯片的视频,流程可控且适应多领域。实验显示其生成视频接近人类表现,还设计了双路径评估策略。

新智元
产品应用7

阿里“快乐马”团队再出手!正面叫板谷歌 Genie 3,世界型 HappyOyster 来了

4月16日,阿里发布世界型产品HappyOyster,由ATH创新事业部团队研发。它与谷歌Genie 3同属世界拟器流派,采用跨度世界演化建,有漫游和导演两大核心能力,在多方面呈现差异化优势。

AI前线
开源动态8

AI记忆革命爆发!Clawdbot如何像大脑般记住一切

2026年初开源个人AI助手Clawdbot引爆社区。它可本地运行、集成聊天平台、自主处理任务,有时记忆和任务执行能力。AI研究工程师Manthan Gupta复盘其记忆机制原理,涉及上下文、记忆存储、搜索等内容。

新智元
算法论文8

重新审视SFT的泛化能力:优化动态、数据与型能力的条件性分析

上海人工智能实验室等联合研究质疑了‘SFT倾向于记忆,RL实现泛化’观点,指出SFT泛化是条件性现象,受优化动态、训练数据、基型能力影响,还揭示思维链SFT会带来安全性能退化。

AI科技评论
开源动态8

Codex给V4-Flash装上眼睛,DeepSeek也会文档OCR

GitHub上的项目codex-vision-proxy让接进Codex的DeepSeek能看图,不用换型或等官方,装本地代理即可。它还附带视觉工具包,在智能文档解析和OCR上潜力大,证明多态能力可在管道上。

CourseAI
开源动态8

腾讯开源混元Image 2.1:2K高清+完美文字嵌入,图文天花板来了

今天凌晨,腾讯开源最新图像型混元Image 2.1,支持原生2K分辨率与提示词,文字嵌入能力强,适用于专业场景。还开源加速版型权重和提示词改写型,评估显示其性能达开源最优,接近闭源商业型。

AIGC开放社区
新闻资讯7

重塑记忆架构:LLM正在安装「操作系统」

现代大型语言型(LLM)存在「记忆缺陷」,难以维持期记忆。近期关于大型记忆的研究增多,如 MemOS 等。文中介绍了上下文处理能力与记忆的关系、记忆类型,以及实现 LLM 记忆的多种方法和相关研究成果。

机器之心
开源动态8

达790年视频镜头,打造原生多态世界型!北京智源研究院用Emu3.5统一“世界”

北京智源研究院发布并开源基于原生多态训练的世界学习者Emu3.5,它将视觉和语言视为同一种数据流,在超13万亿token数据上学习,解决视野多态信息处理问题,经多阶段训练和优化,能力强大且已开源。

AIGC开放社区
产品应用8

MiniCPM 4.0极速狂飙,端侧型的比赛,结束了!

面壁智能联合清华发布MiniCPM 4.0,极限场景220倍加速。它是首个原生稀疏型,有InfLLM v2、CPM.cu等创新,基准测试碾压对手,适配全平台,还有科研、工具调用等功能,标志端侧文本时代到来。

AGI Hunt