「技术运行模型」共找到 9559 篇相关文章
训练效率提升25%、成本降23%!上海期智研究院、算秩未来联合推出MegatronApp:专为万亿参数大模型训练打造的系统工具包
上海期智研究院联合算秩未来在WAIC 2025大会发布开源项目MegatronApp,它是国内首个围绕Megatron - LM的增强工具链。经实际数据,其在该框架下训练效率提25%、成本降23%,含四大模块解决训练难题。
超越英伟达B200!AMD最强AI芯:1.6倍大内存、大模型推理快30%,奥特曼都来站台
AMD发布最强AI芯片MI350X和MI355X,号称大模型推理比英伟达B200快30%,内存是其1.6倍。该系列本月初已批量出货,还发布ROCm 7软件栈。AMD还预告明年推MI400系列,由其与OpenAI联合研发。
Gemini 3预训练负责人警告:模型战已从算法转向工程化!合成数据成代际跃迁核心,谷歌碾压OpenAI、Meta的秘密武器曝光
2025年底大模型“年终决战”,Gemini 3强势突围。其预训练负责人Sebastian Borgeaud指出,谷歌转向“做系统”,AI进入“数据有限”阶段,合成数据等构成未来进化路径,还分享了预训练热点与挑战。
“你的Agent,我一周末就能做出来!” AI时代的护城河:Cursor 卷每日迭代速度,DeepSeek 用技术撕大厂规模优势
文章围绕AI时代创业的“护城河”展开,介绍YC播客讨论内容,指出因ChatGPT易复制,创业者需思考持久商业模式。还列举Cursor、DeepSeek等案例,阐述速度、流程之力等多种构建护城河的方式。
Anthropic新模型杀疯了!成本直降 2/3、性能直逼GPT-5,用户实测:比“吹”的还强,速度超 Sonnet 3.5 倍
Anthropic发布Claude Haiku 4.5版本,成本降2/3、性能逼近GPT - 5,速度超Sonnet 3.5倍。该模型已全平台上线,可处理大文件,安全对齐性佳。它能与Sonnet协同,适用于企业与软件开发,Anthropic业务也在爆发式增长。
英伟达,开始限制Claude使用了
本文援引The Information报道,英伟达、Palantir等大企业因对敏感数据控制权的顾虑,限制Anthropic Claude前沿模型用于核心敏感业务,探讨了企业级AI落地的新矛盾与行业发展方向。
刚刚,加入腾讯的姚顺雨发表首篇Paper~
腾讯混元与复旦联合发表论文《CL-bench》,姚顺雨署名并全面细致审阅反馈。CL-BENCH 首次单独考‘现学现卖’,有独特设计原则、四大题型,其评分杜绝‘差不多’,还让 10 个前沿模型‘翻车’。
18K+标星!视觉AI驱动的浏览器自动化,告别XPath,无惧网页改版!
网页自动化常遇页面更新脚本报废等难题,而开源工具Skyvern不走传统XPath/DOM路子,用视觉+大语言模型理解网页,能自适应改版,功能丰富,安装运行简单。
深度解读:关于 Jev 的几大疑问
本文针对全网爆火的AI模型Jev,梳理业界不同观点,解读其技术路线、核心特性、能力边界与适用场景,解答大众对Jev的核心疑问,客观分析其真实价值。
Anthropic:上下文工程在AI Agents的正确打开方式!
在‘提示工程’后,‘上下文工程’成焦点。它是提示工程延伸,因信息过多模型会‘失焦’,上下文是稀缺资源。文章介绍高效上下文‘解剖学’、运行时检索策略、长周期任务应对方法等。