性能问题」共找到 4798 篇相关文章

新闻资讯8

斯坦福华人天团意外爆冷!AI用纯CUDA-C编内核,竟干翻PyTorch?

斯坦福华人团队用纯CUDA - C编写的快速AI生成内核超越PyTorch,成果登上Hacker News热榜。研究者采用KernelBench任务设置,引入新优化方法,实验显示多数最优内核在靠后轮次出现,优化策略集中在几类常见模式。

新智元
推荐文章7

200行python代码实现从Bigram模型到LLM

本文从`babygpt_v1.py`出发,逐步加入self-attention机制、position嵌入等,实现完整GPT。介绍Transformer结构,讲解位置编码、单头自注意力等机制的代码实现,还阐述后续层的用途、参数调整及训练效果,最后提及模型优化方向。

阿里云开发者
产品应用7

使用 Node.js + OpenAI + MongoDB 实现文本向量知识库搜索

本文介绍用 Node.js、OpenAI Embedding API 和 MongoDB 实现文本向量知识库搜索系统,涵盖环境准备、文本切分与向量存储、本地语义检索等,还提及用 MongoDB Atlas 提升性能及后续延伸方向。

AI Reading Hub
算法论文8

腾讯混元 TurboS 技术报告首次全公开:560B 参数混合 Mamba 架构,自适应长短链融合

日前腾讯混元 TurboS 技术报告全公开。它是超大型 Hybrid Transformer - Mamba 架构 MoE 模型,有自适应长短思维链机制,总参 560B。在多榜单成绩亮眼,多语种和多任务处理能力强,还介绍了核心创新、训练策略等。

InfoQ
新闻资讯8

刚刚,老黄官宣在中国台北建AI超算!

英伟达CEO黄仁勋在Computex 2025演讲官宣,将在中国台湾建首台世界级巨型AI超算及新总部,还推出GB300等新品,介绍NVLink Fusion等亮点,展望AI发展及通用机器人市场。

新智元
算法论文8

Qwen突破:用「并行计算」代替「堆参数」,新方法内存降22倍、延迟降6倍

LLM进化依赖「堆参数」,存在训练成本高、推理慢等问题。论文提出ParScale,用「并行计算」代替「堆参数」,让模型「分头思考」,推理效率提升22倍,旧模型也能改造,落地价值大。

深度学习自然语言处理
新闻资讯7

OpenAI:GPT-5就是All in One,集成各种产品

OpenAI研究副总裁剧透GPT - 5将整合Codex、Operator等产品。团队分享Codex详情与未来计划,回应10大问题,如语言选择、运行方式等,还将推免费API积分,发布了Codex上手指南。

量子位
推荐文章8

浏览器里的 AI 革命:前端工程师的新战场

AI 进入浏览器和前端,JavaScript 扮演新角色。浏览器端 AI 崛起,能在本地提供智能服务。AI 可增强 JS 应用,有多种工具支持,但也面临性能、模型尺寸等挑战,未来前景广阔。

InfoQ
算法论文8

首次披露!DeepSeek V3 发布软硬一体协同训练论文,公开「降成本」秘诀

DeepSeek团队发布论文《洞察DeepSeek - V3:规模的挑战和对AI架构硬件的思考》,从硬件架构和模型设计双重视角,探索其经济高效的大规模训练和推理方法,介绍了设计原则、低精度驱动等多方面内容及降成本秘诀。

AI科技评论
产品应用8

AI重塑搜索:夸克“深度搜索”如何定义下一代信息入口|甲子光年

大模型发展推动搜索产品革新,“搜索”变“深度搜索”。夸克升级AI超级框发布“深度搜索”,即将推出“深度搜索Pro”。其“深度搜索”情商高,“深度搜索Pro”免费、快速、专业,夸克正打造AI全能助手。

甲子光年