计算规模」共找到 1094 篇相关文章

新闻资讯8

Nature公开谷歌IMO金牌模型技术细节!核心团队仅10人,一年给AI编出8000万道数学题训练

谷歌DeepMind的IMO金牌模型AlphaProof技术细节公开。团队规模小,核心成员是IMO金牌得主。它把数学证明当游戏,用30亿参数模型和改进树搜索算法。训练难题靠自动形式化解决,赛场用TTRL突破,已开放使用。

量子位
算法论文8

上下文记忆力媲美Genie3,且问世更早:港大和可灵提出场景一致的交互式视频世界模型

交互式长视频生成缺乏稳定场景记忆,制约下游应用落地。Google DeepMind的Genie 3有强场景一致性但未公开技术细节。港大和可灵提出的Context as Memory模型,上下文记忆力媲美Genie 3且投稿更早,还提升了计算效率。

机器之心
新闻资讯8

a16z 合伙人:AI 正将 10 倍工程师“降级”为 2 倍!应用层已无技术护城河,未来在基础设施和业务深耕

Andreessen Horowitz (a16z) 的合伙人 Martin Casado 在对话中指出,当前AI大模型竞争格局似当年云计算大战,寡头垄断将降临。他还谈到AI对开发者、投资决策、市场格局的影响,以及对AI安全、开源等问题的看法。

AI科技大本营
新闻资讯7

摩尔线程之后,又一家国产 GPU 独角兽完成上市辅导

6月23日,国产GPU龙头沐曦IPO辅导完成,将提交申报材料。其为异构计算提供全栈GPU方案,产品有曦思N、曦云C、曦彩G系列。曾与书生・浦语3.0合作,2024年交付多个算力集群。此外,国产GPU厂商纷纷IPO。

InfoQ
算法论文8

首次披露!DeepSeek V3 发布软硬一体协同训练论文,公开「降成本」秘诀

DeepSeek团队发布论文《洞察DeepSeek - V3:规模的挑战和对AI架构硬件的思考》,从硬件架构和模型设计双重视角,探索其经济高效的大规模训练和推理方法,介绍了设计原则、低精度驱动等多方面内容及降成本秘诀。

AI科技评论
新闻资讯8

黄仁勋砸千亿兆瓦算力,押注下一个“Open AI”

3月10日,前OpenAI高管Mira Murati创办的Thinking Machines Lab与英伟达达成长期合作,英伟达将提供1吉瓦下一代NVIDIA Vera Rubin系统。这一合作规模巨大,显示英伟达全面布局,也体现该创业公司野心,不过其面临组织动荡考验。

AI前线
新闻资讯7

Mira翁荔陈丹琦公司,让老黄掏出了600亿美金

Thinking Machines Lab官宣与英伟达达成新一轮合作,将落地预计成本600亿美元的1GW规模数据中心,含英伟达现金注资。此前英伟达已参与其种子轮融资助其达120亿美元估值,现公司估值达500亿美元。

量子位
产品应用8

参数破万亿!阿里Qwen3-Max-Thinking发布,编程能力“踢馆”Gemini与Claude

阿里发布总参数超万亿的Qwen3 - Max - Thinking,预训练数据规模达36T Tokens。在多项权威测试中表现优异,能与顶级闭源模型竞争。引入两项核心创新,千问App等已上新,网友认可其能力与更新速度。

AI前线
新闻资讯8

陶哲轩用GPT5-Pro跨界挑战!3年无解的难题,11分钟出完整证明

陶哲轩与GPT - 5 Pro合作解决微分几何领域3年未解难题。GPT - 5 Pro从计算到证明一气呵成,助陶哲轩突破思维局限。陶哲轩认为AI在小、大尺度上有用,中尺度无益,还印证多尺度衡量工具有效性观点。

量子位
推荐文章8

Thinking Machines又发高质量博客:力推LoRA,不输全量微调

Thinking Machines 博客力推 LoRA 并与全量微调对比。研究发现小数据量任务中 LoRA 与全量微调效果接近,大数据量稍吃力,强化学习中低秩 LoRA 也能接近全量微调。还揭示了 LoRA 关键要素、超参数规律等。

机器之心