扩散自回归架构」共找到 2209 篇相关文章

开源动态8

读完这篇,你就搞懂 DeepSeek v4 了

2026年4月24日,DeepSeek全新系列模型DeepSeek - V4预览版上线并开源,评分接近‘闭源三巨头’。该模型强在1.6T参数+1M上下文,还有从attention到kernel的系统级重构与优化,在架构和工程层面均有创新。

腾讯技术工程
产品应用8

模型训练篇|多阶段ToolRL打造更可靠的AI导购助手

当前,AI导购成电商与服务平台新风口,但芝麻租赁场景挑战大,存在需求难匹配等痛点。为此打造AI导购智能体“租赁小不懂”,经架构升级和算法优化,性能提升,还探索了MoE训练和推理优化。

阿里云开发者
新闻资讯7

大赚667倍,摩尔线程投资人赢麻了

本文聚焦冲刺“国产GPU第一股”的摩尔线程。它6月获科创板IPO申请受理,88天过会。其创始人张建中履历亮眼,公司自研架构MUSA优势明显。早期投资方沛县乾曜收益高,摩尔线程未来潜力大但竞争也大。

芯师爷
新闻资讯7

创始人押宝AI让公司死而复生,如今市值逼近百亿!CEO:我鼓励年轻人每天拼12个小时

本文讲述对讲机企业 Intercom 创始人 Eoghan McCabe 押宝 AI 使公司逆袭的故事。Eoghan 回归后带领公司转型,推出 AI 代理 Fin,实现业务增长,还进行战略聚焦、文化重建等改革,同时探讨了 SaaS 与智能体、AI 对就业影响等话题。

AI前线
推荐文章7

GPU到底是如何工作的?这篇AI Infra入门全部告诉你

本文详细介绍了GPU工作原理及编程模式。它从图形渲染发展到GPGPU,NVIDIA推动其通用计算。还阐述了CPU/GPU异构架构,对比二者性能,介绍编译、加载、启动过程,以及GPU硬件架构、编程与执行模型,分析SIMD和SIMT。

腾讯技术工程
新闻资讯8

微软刚发布Mu模型:支持Windows智能体,小参数跑出10倍性能

今天凌晨微软发布创新小参数模型Mu,3.3亿参数性能比肩Phi - 3.5 - mini,体量小10倍,离线NPU笔记本每秒超100 tokens响应。它支持Windows智能体,架构有多项创新,经训练优化后智能体表现出色。

AIGC开放社区
新闻资讯8

浙江,冲出一匹碳化硅芯片全球黑马!

在‘双碳’目标与数字中国建设蓝图下,电能管理机遇巨大。黄兴博士指出将供电架构优化为高压直流可降低能耗,关键在于碳化硅功率芯片。其创办的派恩杰半导体,自主研发芯片,从芯片到封装助力客户,迎来产业机遇。

芯师爷
推荐文章8

多智能体在「燃烧」Token!Anthropic公开发现的一切

Anthropic发布多智能体研究系统构建解释,解决多智能体研究困惑。多智能体系统优势明显,在特定任务中表现出色,但token消耗大。其架构独特,还介绍了提示词工程、评估方法、面临的工程挑战等内容。

机器之心
产品应用7

Anthropic更新了Skill Creator,评测框架上线

Anthropic更新Skill Creator,上线评测框架。该框架无需写代码,能处理两类技能测试需求,可测试和改进技能,有捕获质量回归等用途。还增加基准模式、多Agent支持等,能让技能触发更可靠,更新已在Claude.ai等可用。

AI工程化
开源动态8

机器人需要一个「思考系统」:τ0-VLA让具身智能迈向长程任务时代

2026 WAIC落幕,具身智能成焦点。当前VLA模型在长程任务中有局限,上海创智学院和智元机器人联合发布τ(0)-VLA,提出分层架构和新推理机制,用大量真机数据训练,在长程任务表现出色。

机器之心