「系统设计」共找到 2762 篇相关文章
何恺明带大二本科生颠覆扩散图像生成:扔掉多步采样和潜空间,一步像素直出
何恺明团队提出新方法Pixel Mean Flow(pMF),突破传统扩散模型/流模型限制,砍掉多步采样和潜空间,一步在像素空间生成图像,在ImageNet不同分辨率上取得佳成绩,还介绍了核心设计、实验结果对比等。
不跟英伟达走老路,这家GPU公司的技术架构藏着哪些关键解?
在国产GPU上市黄金窗口期,天数智芯上市后首场发布会引发广泛讨论。其公布架构路线图,2027年前追赶英伟达,之后转向创新架构设计。还提出回归计算本质、提供高质量算力两条架构判断,并展示边端算力产品及应用。
MCP 和 Skills 到底什么区别?一篇文章说清楚
文章解释了 MCP 和 Skills 的区别。MCP 是 AI 世界的 USB 协议,可降低开发成本,但会吃掉上下文窗口;Skills 采用渐进式披露设计,自带脚本,能减少上下文消耗。未来 Skills 或承担多数工作,MCP 用于远程连接。
长视频会议纪要、访谈节目精剪AI神器
WhisperVideo是用于长篇幅、多说话人视频的简洁演示系统,专为真实对话构建。它有SAM3视频分割、TalkNet主动说话人检测等功能,具备视觉关联说话人归属等特性,文中还介绍了安装、运行等内容。
对话付昊桓:数值模拟不能被替代,AI 应该放在哪里丨GAIR 2025
在GAIR 2025大会上,付昊桓教授结合地球系统模型与超算实践,探讨数值模拟与AI的边界和可能。他认为数值模拟是基础,AI可补充,二者应深度融合,还谈及气象领域商业价值和未来期待。
罗福莉执掌小米大模型首秀!定调下一代模型,全新MiMo-V2开源还横扫Agent第一梯队
在2025小米人车家全生态合作伙伴大会上,罗福莉首秀解读全新大模型MiMo - V2 - Flash,该模型已开源,采用MoE架构和MTP技术,在多方面表现出色,罗福莉还阐述其设计逻辑与对下一代智能体的看法。
美团开源LongCat-Image,6B参数挑战80B效果,中英双语理解、图像逼真度及复杂指令编辑新突破
美团开源6B参数图像模型LongCat-Image,在双语文本理解、图像逼真度及复杂指令编辑任务中表现出色。它以轻量化设计超越大模型,还解决中文文本渲染难题,有精确图像编辑能力,且提供全链路开源方案。
估值 7 亿美元的 AI 语音输入产品:语音输入的关键问题是听写,不是转录
AI语音输入产品Wispr Flow发展迅猛,ARR 5个月翻10倍,公司估值超7亿美元。其创始人Tanay Kothari认为,该产品与其他同类最大区别是理解用户意图,解决听写而非转录问题,还分享了产品特点等内容。
32倍加速,58秒搞定720p视频!字节发布离散自回归框架,统一视觉生成和长视频生成
字节发布InfinityStar框架,将5秒720p视频生成时间从30多分钟缩至58秒,还支持多样任务。它基于对视频本质思考设计时空金字塔模型,将时空分离,通过多项技术优化,性能表现出色,不过也存在一些技术局限。
华人团队让AI把表格“翻译”成问题,检索速度×5
表格检索在RAG里是小众问题,传统表格问答系统有Retriever和Reader组件,关键是对齐表格与问题语义。QGpT能生成模拟问题,使表格语义更丰富、对齐更准确,分离线、在线阶段,训练后可提升检索收益。