3D-Resampler 架构」共找到 3639 篇相关文章

7

梁文锋首次开口融资,DeepSeek只估值680亿,融资20亿?

据媒体报道,AI初创公司DeepSeek正洽谈以100亿美元估值融资至少3亿美元。该公司此前拒绝融资,此次或因自建数据中心、研发新模型等需大量资金。同时,其两位核心人员跳槽,人才竞争激烈。

机器之心
推荐文章7

一种可以减少 CI 回归测试套件规模的更佳方案

作者作为测试架构师,认为减少CI回归测试套件规模理论诱人但实践常失望。介绍有效处理大型测试套件的方案,如随机趋势分析、多上下文模式匹配等,还谈及无门控测试等优势,能助力管理测试集。

InfoQ
算法论文8

大模型能“原地”改参数了!字节Seed&北大新论文:测试时推理无需加层重训练

字节Seed和北大研究团队提出In - Place TTT方案,让大模型能“原地改参数”。它复用Transformer的MLP模块,解决现有TTT架构不兼容、计算效率低和优化目标不匹配问题,实验证明可提升模型长文本任务表现。

量子位
开源动态8

OpenDev:破解AI编程指令衰减难题

当下AI编程工具竞争激烈,大多存在闭源或绑定单一模型的问题。OpenDev是开源的终端AI编程Agent,用Rust编写,仅3.7MB。其论文详细解释设计决策,给出指令衰减问题的工程解法,还有多种实用设计。

CourseAI
算法论文8

东方理工团队提出HiDrop:重构MLLM计算路径,压缩90%视觉Token实现2.2倍加速

东方理工大学沈晓宇团队提出HiDrop,基于MLLM不同层功能差异,设计出延迟注入、凹金字塔式剪枝和提前退出的视觉Token压缩策略。实验显示,它能压缩约90%视觉Token,保持98.3%性能,实现训练和预填充加速。

机器之心
产品应用7

748GB内存、20P算力,英伟达把数据中心塞进了桌子底下,第一台已经送到Karpathy家里

英伟达DGX Station GB300首批系统交付开发者,首台给了Andrej Karpathy。它有748GB内存、20P算力,用GB300芯片架构。背后是长时运行自主智能体开发需本地算力,英伟达从软硬层面推进。

AI寒武纪
新闻资讯7

理解了巴菲特“补票”谷歌,就理解了字节、阿里与腾讯的AI入口大战

2026年初,字节、阿里、腾讯围绕AI入口与生态展开争夺。从巴菲特卖苹果买谷歌案例可理解这场大战,谷歌建成AI全栈生态,其他科技巨头布局时各有挑战,AI时代建立生态才能不败。

芯师爷
产品应用8

美团提出全新多模态统一大模型STAR,GenEval突破0.91,破解“理解-生成”零和困局

近日美团推出多模态统一大模型 STAR,以“堆叠自回归架构 + 任务递进训练”实现理解与生成双重突破。它解决行业痛点,通过三大核心设计统一能力,实验在多任务中表现顶尖,还给出后续探索方向。

机器之心
开源动态8

Token洪流的转向:当AI Agent成为Token消耗的主宰,什么样的推理服务基础设施才是刚需

Token消耗量转移,AI Agent成Token消耗主宰,大模型推理服务底层逻辑重塑。文章介绍AI Agent时代范式转变、对推理基础设施的需求,还阐述了为其打造的AI Serving Stack架构及优势,它获2025年度相关卓越奖。

AI前线
开源动态7

长视频会议纪要、访谈节目精剪AI神器

WhisperVideo是用于长篇幅、多说话人视频的简洁演示系统,专为真实对话构建。它有SAM3视频分割、TalkNet主动说话人检测等功能,具备视觉关联说话人归属等特性,文中还介绍了安装、运行等内容。

GitHubStore