「观测的暴露度」共找到 10774 篇相关文章
GPT-5攻入数学圈,证明定理快过博士生?网友热议AI新角色
9月初,arXiv一篇论文将GPT - 5写进数学研究成果。它解决了第四矩定理‘收敛速度’的空白,还在凸优化领域提升收敛界限。不过它常犯错,需人类引导,且成果原创性存疑,引发对科研和博士培养的担忧。
跨芯片统一优化,DLCompiler与DLBlas驱动算子极致表现
9月10日,上海AI实验室DeepLink团队开源DLCompiler和DLBlas。前者是扩展Triton的深度学习编译器,后者是面向大模型的高性能算子库。它们有跨架构DSL扩展等亮点,在多芯片上实现性能优化,还解决了DSA芯片优化难题。
EMNLP25 | 北大x腾讯光子发布 C3 Benchmark:中英双语语音对话模型“地狱级”测试基准,直击语音对话模型软肋!
近年来语音对话模型受关注,但处理人类对话复杂现象的效能缺乏研究。北大联合腾讯光子构建中英双语C3 Benchmark数据集,评估模型应对复杂对话的能力,结果揭示性能瓶颈,为模型优化提供参考,代码和数据已开源。
我去,真牛!Coze Studio 开源版究竟有多火?看 GitHub 最新 1.4k star 人气飙升!
Coze Studio是低代码、可视化的AI Agent开发平台,有Apache‑2.0开源许可,降低使用门槛。它能解决非专业开发者、企业等构建智能对话助手的痛点,核心功能亮点多,应用场景广,在国产AI Agent开发生态潜力大。
【博客转载】CUDA Reduction
文章来自Lei Mao,介绍CUDA归约操作。先阐述归约操作在并行计算中的常见性,接着实现两个批量归约求和kernel,还给出构建和运行示例的命令及结果。最后探讨大数组归约求和的方法及性能影响。
图解Vllm V1系列5:调度器策略(Scheduler)
本文是图解Vllm V1系列5,聚焦调度器策略。先回顾vllm v1整体运作流程,接着阐述调度 - 推理的整体流程,包括将请求添加进Scheduler、Scheduler单步调度策略等,还对比了不同场景下的函数及调度逻辑。
强化学习之父Richard Sutton:人类数据耗尽,AI正在进入“经验时代”!
强化学习之父Richard Sutton在演讲中指出,人类数据耗尽,AI正进入“经验时代”,真正的AI要从与世界互动的“经验”中获取数据。他还认为创造超级智能体是好事,人类和AI繁荣应基于“去中心化合作”。
200行python代码实现从Bigram模型到LLM
本文从`babygpt_v1.py`出发,逐步加入self-attention机制、position嵌入等,实现完整GPT。介绍Transformer结构,讲解位置编码、单头自注意力等机制的代码实现,还阐述后续层的用途、参数调整及训练效果,最后提及模型优化方向。
DeepSeek-R1-0528 打榜、20+案例全面实测,全球网友狂点赞:实力堪称R2!
DeepSeek 上新的 DeepSeek - R1 - 0528 让 AI 圈沸腾。它在 LiveCodeBench 榜单飙升至第 4 位,性能逼近 OpenAI 的 o3 高级版。全球网友实测后好评如潮,其在多方面能力出色,且完全开源,引发对 R2 的期待。
微软 CEO 萨提亚·纳德拉:智能体即产品,SaaS 已死?
微软 CEO 萨提亚·纳德拉在 Build 大会后接受专访,称正经历软件与智能范式巨变,AI 驱动的智能体网络将重塑企业软件未来,SaaS 会融入其中。他还分享了 AI 时代软件与商业模式变革的核心洞察。