「Llama-3.2-1B」共找到 3534 篇相关文章
疯狂!也就2500辆车上路,完成8760亿估值新融资
Waymo官宣完成160亿美元融资,估值超8760亿,较1年半前翻近3倍。其业务分Robotaxi和新业务,今年将扩张至全球20多城。中国Robotaxi玩家萝卜快跑等在业务上有进展,但与Waymo的估值差距大。
华人女学霸AI杀疯!本科最难数赛12题全对,自主证明首次公开
24岁华人女学霸Carina Hong初创打造的AxiomProver,在2025 Putnam数学竞赛拿下满分,其自主生成的Lean证明也公开。该竞赛是北美本科生数学竞赛天花板,人类满分罕见。此外,GPT - 5.2 Pro数学表现也很强,引发“奇点将近”之感。
智元办机器人挑战赛:清华&上海AILab夺冠,华南理工“单人成团”拿亚军
由智元机器人联合OpenDriveLab举办的AGIBOT World Challenge线下决赛在杭州IROS落幕。全球11支顶尖队伍在六大真实物理任务中角逐,清华联合上海AILab团队夺冠,华南理工、港大团队分获二、三名。智元还展示了产品线,精灵 - G2首次公开亮相。
AI圈再颠覆!中国AI翻译耳机通话翻译,实测震撼
科大讯飞发布全新AI翻译耳机,上海与迪拜连线对话实测表现震撼,响应延迟低至两秒。其集成“端到端语音同传”技术,采用“骨导+气导”设计。此外,翻译机2.0也升级,科大讯飞在AI翻译领域优势显著。
为什么 DeepSeek 大规模部署很便宜,本地很贵
文章探讨了DeepSeek-V3大规模服务便宜但本地运行贵的原因。指出推理服务存在吞吐量和延迟的权衡,受批处理大小影响。还分析了不同模型需大批次的原因,如专家混合模型、大型管道模型等。
深度解读 DeepSeek V4.1 Flash 全新架构,如何成为显存杀手
本文深度解读DeepSeek最新发布的V4.1 Flash大模型,详解其全新CED架构与第二代压缩稀疏注意力CSA2,揭秘其通过架构创新大幅压缩KV缓存、降低显存算力成本,在长上下文Agent场景实现性能反超的细节。
Grok4全网玩疯,成功通过小球编程测试,Epic创始人:这就是AGI
发布不到一天,Grok4就被网友玩疯。它通过六边形小球编程测试,动画表现出色。大佬Tim Sweeney称其为AGI,马斯克附议。还有网友用多种方式测试,如与o3对比、SVG绘图等,Grok4表现有亮点。
西游取经团再出征:小米 Token Plan 能把 Token 价格打下来吗?
4月3日小米发布首款“走字儿”Token Plan计费方案,以Credit换算Token,不同模型换算比例不同,取消使用时间限制。实测MiMo V2 Pro完成任务水平在线,成本约为Lite套餐60%,但Token消耗难预估,其价值取决于任务场景。
18岁天才少年,登上Nature封面!
DeepSeek-R1荣登Nature封面,成史上首个经严格同行评议大模型。18岁天才少年涂津豪以实习生身份参与,其从高中生到Nature作者的经历堪称传奇。他还改造Claude 3.5,开源项目获15k多星,还对AGI发表思考。
4 个月狂飙 22k Star,这本书凭什么?
Github上超火的开源项目《LLMs-from-scratch》中文版4月上市,4个月涨超22k Star。作者实操搭建类GPT - 2模型,涵盖大模型构建全流程。用PyTorch开发,代码少且有注释,对初学者友好,豆瓣评分9.3。