混合专家层」共找到 975 篇相关文章

产品应用8

阿里 Qoder 把这 AI 编程的窗户纸捅破了

2025年大模型下沉到应用,浏览器和编程工具被重新发明。阿里新发布的Agentic编程平台Qoder,增强对巨大代码工程理解能力和代码生成准确率,其上下文工程观是突破,新引入的Quest Mode很独特。

MacTalk
开源动态7

Harness Engineering 实践:Fitness Function 如何成为 AI 交付的防腐

文章探讨 Harness Engineering 实践中,Fitness Function 如何成为 AI 交付防腐。指出在 AI Agent 参与开发时,判断任务完成是难题,介绍 Routa 项目构建 Fitness 架构及规则执行等实践。

phodal
算法论文8

打破长视频理解瓶颈:HoPE混合位置编码提升VLM长度泛化能力

如今视觉语言模型在长上下文任务表现不佳,CMU和小红书团队深入研究,首次提出多模态RoPE扩展策略理论评估框架,指出现有泛化能力不足原因,提出HoPE大幅提升VLM长度泛化能力。

机器之心
新闻资讯7

DeepSeek深夜更新后自曝:我是V4(?!)

DeepSeek网页端深夜大更新,推出「快速模式」和「专家模式」,还有「视觉模型」开启灰度测试。虽官方未说明,但网友推测专家模式可能是V4或V4 Lite,完整版V4或许不远。

量子位
产品应用8

阿里发布Qwen3-TTS:跨语言混合无缝切换,方言音色全面覆盖!

TTS技术从单一合成进化到多模态表达,但传统模型在跨语言/方言混合场景有不足,商业工具费用高且不开源,开源方案训练数据少。阿里推出Qwen3 - TTS,实现人类级自然度和表现力,功能强大,应用场景多。

开源星探
算法论文8

Transformer祖传设计遭暴击,COLM顶会三篇论文发难

COLM 2026上,三篇论文对Transformer关键技术发难。《Cracks in the Foundation》指出长上下文架构选择影响大;《Lost in Backpropagation》揭示输出投影信息损耗严重;《When Fewer Layers Break More Chains》表明剪枝影响长链推理。

量子位
算法论文8

从单领域到多能力协同:数据混合如何重塑AI的强化学习

上海AI Lab的OpenDataLab团队通过大规模实验剖析可验证强化学习(RLVR)在多领域推理中的机制,发现逻辑与数学数据相互支持、代码推理有跨领域混合效应等,为构建AI推理模型提供关键发现。

深度学习自然语言处理
算法论文8

大模型训练的不稳定性有望彻底解决,MIT新研究用谱正则化替代归一化

MIT团队创造Lipschitz Transformer,用谱正则化替代归一化,认为或解决训练不稳定根本原因。他们对比多种方法权衡,发现Muon + 奇异值裁剪推动权衡边界,且工作完全开源。

AGI Hunt
新闻资讯7

Meta百亿抢人内幕!清华学霸转行AGI拿千万年薪,教授校友看呆了

为打造ASI,Meta、贝索斯等狂砸百亿招聘专家当AI的「老师」。Meta成立「超级智能」AI实验室四处挖人,其「超级智能」成员名单里一半本科毕业于国内大学。同时,AI数据标注行业产业升级,专家获加薪。

新智元
产品应用8

mem0推出王炸mcp工具OpenMemory,打造用户私有、跨应用的共享记忆

mem0项目推出OpenMemory MCP,这是专为兼容MCP的AI客户端设计的私有记忆,能解决跨AI工具的Context共享问题。它强调隐私和本地控制,功能实用,获用户积极反馈。

AI工程化