「超级能动性」共找到 2884 篇相关文章
小钢炮开源,一张3090两小时「从零训练0.1B全模态模型」,模型训练彻底平民化
MiniMind - O是开源超轻量级端到端全模态大模型,采用双轨架构。仅需一张RTX 3090,2小时就能从零训练全链路。有两套训练数据,具备零样本声音克隆等特点,实现大模型训练平民化。
LLM近期重大架构进化一览:从Gemma 4到DeepSeek V4
近期大模型长上下文需求增长,成本问题凸显。Google Gemma 4、Poolside Laguna XS.2、Zyphra ZAYA1 - 8B、DeepSeek V4 等模型各有架构优化,如 Gemma 4 跨层 KV 共享和 PLE,以降低长上下文推理成本。
模型的自我进化,可能真的开始了。
昨天Hermes Agent更新支持原生Windows,安装简单。它调用量超OpenClaw成榜首,与MiniMax M2.7组合迭代快,能长程干活、自主迭代解bug,还可复刻文档风格样式,两团队正合作后训练项目。
马斯克22万张GPU全卖给Claude用:5小时限额翻倍,双方合作建太空算力
马斯克和Anthropic签署算力合作协议,将旗下Colossus 1超算集群全部给Claude用。此前马斯克抨击过Anthropic,合作后态度转变。此交易或改写AI算力格局,且三家计划IPO的公司故事也因此改写。
“客户测950,不到一周下单了”,DeepSeek V4 逼出昇腾真功夫
昇腾计算业务副总裁张良透露昇腾近期销量好、认可度提高,大量客户基于其做训练。DeepSeek V4 考验昇腾,其超节点产品均支持。昇腾还对芯片体系和软件栈升级,拒绝仿 CUDA,坚持自主构建生态。
Lyft 使用 AI 和人机协同扩展了全球范围内的本地化能力
Lyft 实现 AI 驱动的本地化系统,加速应用与网页内容翻译。新系统结合大语言模型、自动评估与人工审核,将翻译周期从数天缩至分钟级,兼顾质量与适配性,还分批量和实时翻译架构处理不同场景。
刚刚,小扎终极野心曝光:为数十亿人提供个人超级智能!
Meta宣布与博通定制AI芯片合作延至2029年,初始投入超1GW算力。扎克伯格称要为数十亿人提供个人超级智能。Meta自研MTIA芯片,两年推四代,还成立超级智能实验室,欲成AI基建主导者。
北大团队改造DeepSeek注意力,速度快四倍还不丢精度
北大张牧涵团队提出新稀疏注意力机制HISA,突破64K上下文索引瓶颈,相比DSA提速2 - 4倍,且不丢精度、即插即用。该机制分块级粗过滤和块内精挑字符两步,实测表现亮眼,也指出后续改进方向。
继GPU、存储暴涨之后,AI最终攻陷CPU市场
AI引发全球性芯片短缺,GPU、内存、存储类芯片市场已超预期,如今CPU市场也受影响。Intel和AMD 3月上调CPU价格,平均涨幅10% - 15%,还面临资源短缺,交付周期延长。这或使CPU市场格局出现变化。
两月蒸发1.6万亿:SaaS 被AI「杀死」了吗? | GAIR 025
今年初,北美软件股两月蒸发超1.6万亿美元,引发对SaaS未来的担忧。雷峰网圆桌中,何润、Daniel、吴昊三位行业老兵探讨现状与未来,认为AI冲击下,SaaS虽面临挑战,但不会被杀死,正全面转型。