「非Transformer架构」共找到 2517 篇相关文章
从哲库到小米,从造芯之“死”到造芯之生
文章回顾华为、小米、OPPO造芯历程,分析OPPO哲库夭折与小米重启造芯的原因。指出小米重启造芯有财务、组织架构、经验等优势,且赶上制裁“窗口期”,AI时代也需自研芯片。
Speech LLM 的下一个突破口:你的语音大模型可以是个「带韵律的文本模型」
语音大模型存在‘模态代沟’致性能‘降智’,此前两波改进未根本解决。香港中文大学论文提出TextPro - SLM架构,从输入端破局,仅用约1000小时数据就实现低‘模态代沟’,对多模态模型设计有启发。
DeepSeek多模态新范式:一张图压缩7056倍,思考能力反超GPT和Claude
DeepSeek上线多模态并开源新范式技术。该研究让AI用视觉原语思考,弥合语言与视觉指代鸿沟。它构建紧凑模型架构,信息压缩率达7056倍,训练分三阶段,测试中表现出色,也存在局限。
GPU时代落幕?硅谷巨头集体「叛逃」,英伟达1500亿疯狂自救
去GPU化浪潮来袭,AI竞争焦点从算力规模转向能效比与延迟。谷歌TPU性能提升且成本低,走向商用受青睐。英伟达天价收购Groq,多元架构正终结GPU单极时代,国产芯片需底层创新。
Gemini准确率从21%飙到97%!谷歌只用了这一招:复制粘贴
Google Research研究发现,将输入问题复制粘贴一遍,能让大模型在非推理任务上准确率惊人提升,如Gemini 2.0 Flash - Lite从21.33%升至97.33%,且几乎不影响生成速度,但不适用于推理场景。
今夜无显卡!老黄引爆Rubin时代,6颗芯狂飙5倍算力
CES 2026上,英伟达黄仁勋发布Vera Rubin超算架构,推理性能比Blackwell提升5倍,训练性能提升3.5倍,成本降10倍,已投产,下半年商用。还展示自动驾驶模型等,且无新显卡发布。
Orion:面向注重隐私用户的新型浏览器——零遥测、零广告、防范 AI 追踪
Kagi发布新型浏览器Orion 1.0,默认注重隐私、零遥测、无集成广告跟踪技术。它支持Chrome和Firefox扩展,将AI排除核心以保安全,资金源于付费订阅。不过因非开源,隐私声明遭质疑。
腾讯组织大调整,前 OpenAI 研究员姚顺雨担任首席 AI 科学家
腾讯进行组织架构大调整,成立AI Infra部等部门。前OpenAI研究员姚顺雨出任首席AI科学家,兼任多职。此次调整旨在整合模型、数据、算力,腾讯还大力招募人才,此前元宝借开源起量,凸显自研重要性。
DeepSeek悄悄开源LPLB:用线性规划解决MoE负载不均
昨天,DeepSeek 在 GitHub 上线新代码库 LPLB 解决 MoE 负载不均。它利用线性规划算法优化专家并行工作负载分配,能处理动态波动,但也存在忽略非线性成本等局限,对 MoE 架构训练加速有参考价值。
干掉 90% 的 BI 工程师:自动生成 SQL、洞察、预测,连图表都帮你画好
介绍了基于LLM和RAG的结构化数据问答系统,它能将查询转化为SQL语句执行,生成数据图表及分析。其看板用法新颖,可进一步分析、预测,免去大部分BI工作,对非技术分析人员友好。