「包大小优化」共找到 1376 篇相关文章
Cursor 0.50 版本升级后如何省钱又高效?一份给开发者的避坑指南
本文围绕Cursor编程助手日常应用展开,讲解计费机制、工具调用等核心要点,结合实践给出高效使用方法论与避坑指南,如合理选模型、巧用工具、设置规则等。
CUTLASS CuTe GEMM细节分析(一)——ldmatrix的选择
作者作为CUTLASS CuTe初学者,记录问题分析过程。本文聚焦如何基于TiledMMA及输入矩阵在Shared Memory上的Layout选合适Copy Operation完成拷贝,结合实例讲解ldmatrix指令选择,还给出参考代码。
开源DeepSeek R1增强版:推理效率快200%,创新AoE架构
德国TNG公司开源DeepSeek R1增强版DeepSeek - TNG - R1T2 - Chimera,基于三大模型混合开发,采用创新AoE架构,推理效率比R1 - 0528快200%,成本大减,在主流测试中性能更好。还介绍了AoE架构构建子模型方法。
如何做到在手机上实时跑3D真人数字人?MNN-TaoAvatar开源了!
阿里巴巴淘宝Meta技术团队研发的TaoAvatar技术,能在手机或XR设备实现3D数字人实时渲染与AI对话。今日开源MNN - TaoAvatar应用,可在手机运行,对比主流方案更高效便捷,还介绍其优势、技术及使用说明。
告别微调时代:拖拽式LLMs实现12000倍加速适配,输入描述,秒级定制LLM,效果、速度全面超越
传统高效微调技术成大规模部署瓶颈,论文提出Drag-and-Drop LLMs (DnD),仅需输入目标任务未标注提示,即可秒级生成适配的LoRA权重,实现LLM秒级免训练适配,效率、性能和泛化性上均有突破。
火山引擎AI开发「全家桶」大升级,Agent再也没有门槛。
火山引擎Force原动力大会后,其AI开发“全家桶”升级。会上展示多个开源项目,如DeerFlow、veRL、UI - TARS。还提出AI云原生概念,另有MCP、PromptPilot等产品,助力开发者降本增效。
单卡搞定万帧视频理解!智源研究院开源轻量级超长视频理解模型Video-XL-2
智源研究院联合上海交通大学等机构发布新一代超长视频理解模型Video-XL-2。它单卡能处理万帧视频,编码2048帧仅需12秒,在效果、长度和速度上全面优化,已开放模型权重。
打破56年数学铁律!谷歌AlphaEvolve自我进化实现算法效率狂飙,堪比AlphaGo“神之一手”
谷歌DeepMind联合顶尖科学家打造「通用科学人工智能」AlphaEvolve,打破矩阵乘法领域56年效率基准,将4x4矩阵乘法标量乘法次数从49次降至48次,还在谷歌内部加速了运算、缩短训练时间。文中介绍其原理与技术。
OpenAI推出云端编程智能体Codex,进一步推动软件工程领域变革
OpenAI昨夜发布研究预览版Codex,一款集成在ChatGPT中的高级编码智能助理。它基于codex - 1模型,支持多种编程语言,有深度代码分析等核心功能,还有codex - mini - latest API版本,或重构软件开发行业。
日志采集效能跃迁:iLogtail 到 LoongCollector 的全面升级
2025年,iLogtail正式升级为LoongCollector,实现日志采集和处理领域的新跨越。它架构升级,有多样Pipeline形态,性能提升,稳定性和隔离性增强,还具备网络探测、无缝迁移等优势,将带来可观测数据全栈采集新体验。