「推理路径调控」共找到 2510 篇相关文章
Anthropic顶级Claude模型被逆向开源,这几个模块借鉴了DeepSeek
22岁开发者逆向开源Anthropic的Claude Mythos Preview模型架构,名为OpenMythos。其核心模块借鉴DeepSeek,采用带混合专家路由机制的循环Transformer,有独特设计和稳定机制,重新框定扩展性争论。
重磅!中国团队发布SRDA新计算架构,从根源解决AI算力成本问题,DeepSeek“神预言”成真?
国内玉盘AI团队发布《SRDA AI大模型专用计算架构》白皮书,提出全新SRDA计算架构,从硬件源头解决AI算力成本瓶颈。它以数据流为核心,在内存、网络等方面创新,为开发者带来高效、低成本等价值。
从零开始200行python代码实现LLM
文章从传统思路实现诗词生成器入手,介绍了词汇表、Bigram模型等概念,接着用Python和PyTorch实现了真正的Bigram模型,阐述模型、训练等内容,最后回顾成果,下一篇将基于此实现完整GPT。
ECCV 2026 | 北大团队提出 Atomic Dance:基于原子动作的可解释音乐舞蹈生成框架
北大团队提出 Atomic Dance 框架,以原子动作作为舞蹈基本单元,建立有明确语义和结构的舞蹈表示,设计“动作规划 — 舞蹈生成”两阶段框架,让生成的舞蹈更符合音乐节奏和编舞逻辑,具备可解释性和可编辑性。
Show me《指环王》!卡帕西强推大模型评测新基准
大神卡帕西宣称Anthropic用《指环王》给大模型评测上强度,这一‘指环王基准’正接替‘鹈鹕骑自行车’SVG测试。虽Opus 5生成的画面粗糙,但网友测试展现出丰富创意,不过新测试也引发争议。
Claude惊人真相被教授曝光:思考过程加密,给钱也看不到!
Anthropic推出extended thinking,包装成让用户看到思考过程的透明标杆,但实际仅展示部分内容,核心思考被加密。开发者发现异常,密码学教授逆向有发现,这暴露了其透明度悖论和信任问题。
支持30种语言,多种中文方言 [四川话、粤语等]的颠覆性无分词器TTS系统
VoxCPM是无离散音频分词器的语音合成系统。VoxCPM2基于MiniCPM - 4构建,有20亿参数,支持30种语言和9种中文方言,具备音色设计、可控声音克隆等特性,还完全开源,商用就绪。
魔法原子,105亿瞄准具身智能终局
2026 年很多行业被 AI 重塑,具身智能赛道尤为明显。魔法原子推动生态基金布局,撬动超 105 亿资金,完成 5 亿融资。它推进多维度‘连接能力’,构建系统能力与落地场景,成资本与行业关注样本。
谷歌看了都沉默:自家「黑科技」火了,但为啥研发团队一无所知?
当科技圈为‘谷歌黑魔法’兴奋时,所谓‘并行验证循环’可能是AI生成的‘赛博跳大神’。它号称超越思维链,性能提升显著,但发帖者身份存疑,无可靠源链接,其真实性遭业内质疑。
视觉生成的另一条路:Infinity 自回归架构的原理与实践
本文整理自字节跳动韩剑在AICon 2025北京站的分享,以Infinity为例介绍自回归视觉生成原理,对比其与扩散模型,展示Infinity升级方案成果,它在高分辨率文本到图像任务能与扩散模型竞争。