单步」共找到 606 篇相关文章

算法论文7

R1/Qwen训练新范式:无需继续训练,直接“算”出权重,提效500%

DeepSeek - R1爆火让RLVR成大模型后训练焦点,但训练代价高昂。学者发现RLVR中LLM权重和输出概率呈线性变化,提出“权重外推”等方法,实现最高6.1倍训练加速,RL - Extra在多榜展现高效率。

PaperAgent
新闻资讯8

黄仁勋手撕「AI泡沫」论!英伟达570亿铁拳暴击,显卡全断货

英伟达Q3 2026财报显示季度营收达570亿美元,数据中心业务同比狂涨66%。黄仁勋称AI不是泡沫,而是计算范式从通用CPU转向加速式GPU计算的必然。当前多数AI公司估值高、收入低,英伟达作为‘卖铲人’大获全胜。

新智元
开源动态7

让NCCL性能起飞的symmetric memory是啥黑科技?— part2

本文是NCCL 2.27新特性系列的第二部分,主要分析symmetric primitives的实现机制,介绍其提供的接口,如获得symmetric ptr、barrier、send、recv、llEpoch控制等接口,还解析了底层结构内存布局、各接口工作机制及LL Buffer划分机制等。

GiantPandaLLM
新闻资讯7

DeepSeek正开发高级AI Agent模型,硬刚OpenAI

彭博消息,DeepSeek正开发高级AI Agent模型与OpenAI竞争。此模型能在极少指令下执行多任务并自我优化,计划Q4推出。此前该司模型表现佳,技术已在多领域落地,但构建AI Agent仍有挑战。

AIGC开放社区
算法论文8

解决扩散模型过拟合的创新框架T-LoRA

预训练大型文本到图像扩散模型定制化时,样本有限易致过拟合。AIRI和HSE大学团队提出T - LoRA框架,动态调整训练能力、用正交初始化,实验显示其在图像和多图像任务表现优,用户更偏好其生成图像。

AIGC开放社区
推荐文章7

200行python代码实现从Bigram模型到LLM

本文从`babygpt_v1.py`出发,逐加入self-attention机制、position嵌入等,实现完整GPT。介绍Transformer结构,讲解位置编码、头自注意力等机制的代码实现,还阐述后续层的用途、参数调整及训练效果,最后提及模型优化方向。

阿里云开发者
开源动态8

DeepSeek-R1-0528 打榜、20+案例全面实测,全球网友狂点赞:实力堪称R2!

DeepSeek 上新的 DeepSeek - R1 - 0528 让 AI 圈沸腾。它在 LiveCodeBench 榜飙升至第 4 位,性能逼近 OpenAI 的 o3 高级版。全球网友实测后好评如潮,其在多方面能力出色,且完全开源,引发对 R2 的期待。

AGI Hunt
推荐文章7

AI圈刚开始谈Loop Engineering,两位95后博士已经盯上了人类闭环数据

AI圈热词Loop Engineering强调AI工程应从次prompt转向设计持续运行的闭环系统。具身智能争抢人类第一视角数据,脸谱心智由95后博士创立,发布Looped World Models,还提出Ego - NeuroLoop数据范式及相关采集和增强工具。

机器之心
产品应用8

跨维智能DexWorldModel斩获榜首,世界模型真正的考场在机器人执行里

今年4月,Generalist AI发布GEN - 1,其CEO表示不再将模型归类为VLA。当下VLA和世界模型是具身智能主流技术路线,多数世界模型在机器人任务上有瓶颈。跨维智能DexWorldModel在RoboTwin榜表现出色,还开源EmbodiChain助力行业。

量子位
开源动态8

写Verilog、调CUDA,总翻车?工业代码大模型开始学会「先想后写」了

工业代码大模型缺的往往是‘想’的能力。北航联合多家位提出的InCoder - 32B Thinking,让模型结合工业环境思考,通过ECoT从错误中学习,用ICWM提前预判结果,还能自适应思考深度,且模型与代码已开源。

机器之心