并行思考」共找到 862 篇相关文章

开源动态7

DeepSeek开源MoE新利器LPLB:基于线性规划,专攻训练动态负载不平衡

DeepSeek在GitHub开源LPLB,这是基于线性规划的并行负载均衡器,用于优化MoE模型专家并行工作负载分配。它通过动态重排序、副本构建等机制实现动态负载均衡,支持多种拓扑结构,但也存在成本估算等局限性。

AI寒武纪
算法论文8

推理速度飙升5倍,苹果提出全新Multi-Token生成框架!

自回归语言模型逐词生成文本拖慢推理速度、限制并行能力。Apple提出全新框架,挖掘其对未来词元“先验知识”,通过多项技术并行预测多词元,微调预训练模型可显著提速且不损输出质量。

PaperAgent
开源动态8

社区供稿丨Ring-2.5-1T,思更深,行更远

今天发布并开源万亿参数思考模型 Ring-2.5-1T,在生成效率、思考深度、长程执行上大幅提升。与其他模型对比,在高难推理和长程任务执行达开源领先。介绍架构优势、手搓案例,也提及不足与未来计划。

Hugging Face
开源动态8

Qwen3.6-27B 开源:小小身材,超级码力

阿里云宣布开源 Qwen3.6-27B 多模态模型,支持多模态思考与非思考模式,在智能体编程方面超前代旗舰 Qwen3.5-397B-A17B。它已在 Qwen Studio 上线,开源权重可从 Hugging Face 和 ModelScope 下载,阿里云百炼 API 即将支持。

千问大模型
新闻资讯7

大模型终于通关《宝可梦蓝》!网友:Gemini 2.5 Pro酷爆了

Gemini 2.5 Pro在直播中通关《宝可梦蓝》,谷歌CEO官宣。文中介绍其通关过程、玩游戏基本步骤,还探讨宝可梦对大模型的挑战,谷歌将继续探索,网友提议用通关宝可梦测试大模型 。

量子位
产品应用7

变天了!WindSurf推出workflow功能,低代码大模型应用开发平台将面对“降维”打击

Windsurf在1.8.2版本推出workflow功能,其采用自然语言定义工作流并与开发IDE深度集成,是更高级形态。该功能特性丰富、应用场景多,对Dify等应用编排工具或造成‘降维打击’。

AI工程化
推荐文章8

Karpathy又封神!掀翻RAG,把你的笔记变成第二大脑

前OpenAI创始成员Andrej Karpathy提出让大模型把笔记「编译」成持续生长的活Wiki,替代RAG。他将笔记当源代码,LLM当编译器,实现知识结构化。此方案降低维护成本,解放人类注意力。

新智元
算法论文8

能进化的Skill,才是好Skill~

2026年,我们追求“越干越好”的Agent。AutoSkill和XSKILL两篇论文指出,静态的Skill只是高级Prompt,能自我进化的Skill才是真正的数字资产,还介绍了两者的设计、优势及未来Skill的标准形态。

PaperAgent
推荐文章8

前资深亚马逊工程师高效使用Claude Code指南

前资深亚马逊工程师Eyad分享高效使用Claude Code指南,包含先思考再打字、用好CLAUDE.md、避开上下文窗口陷阱等实用技巧,助开发者与工具流畅协作。

AI工程化
开源动态8

字节开源高效解析文档图像的新型多模态模型Dolphin,快速将复杂的文档图像转化为结构化数据。

字节开源新型多模态模型Dolphin,采用“先分析后解析”范式,能将复杂文档图像转化为结构化数据。它有卓越性能和多种特性,还提供安装、推理使用指南。

GitHubStore