能碳产业大模型」共找到 10382 篇相关文章

算法论文7

中移动九天团队MultiPL-MoE:全新Hybrid-MoE架构用于增强通用大模型低资源代码

大语言模型在有限计算资源下提升多语言代码力面临挑战。中国移动九天团队提出 Hybrid MoE 架构 MultiPL - MoE,耦合两层专家选择机制优化,实验证明其在增强低资源代码力、缓解高资源语言遗忘上有效。

机器之心
新闻资讯7

GEO最新风向:Google官方GEO分享与Bing站长工具GEO新功,附白杨SEO看法

本文整理谷歌和必应官方GEO分享。Google的Danny Sullivan谈AI搜索,强调好SEO即好GEO,内容要非同质化;Bing预告站长工具GEO新功,如优化建议、引用份额指标等。

白杨SEO优化教程
新闻资讯7

陶哲轩回应OpenAI宣称内部实验模型获得IMO金牌:不予置评「测试方法不公开就是“作弊”?」

OpenAI宣称内部实验模型获IMO2025金牌,陶哲轩呼吁对AI竞赛表现保持审慎。他强调评估AI不只看结果,测试方法很重要,对未公开测试方法的自我报告成绩不予置评。

AI寒武纪
算法论文8

TACL 综述 | 别只卷架构了——长文本模型力天花板,其实是数据决定的

该 TACL 综述首次从数据视角审视长上下文语言模型,指出长上下文力本质是数据驱动。它建立分类体系,明确高质量长文数据条件,给出核心力的数据配方与评估法,还整理数据集和基准,提出待解问题。

深度学习自然语言处理
新闻资讯7

2025 IMO真题撕碎AI数学神话,全球顶尖模型齐翻车!冠军铜牌都拿不到

2025 IMO数学竞赛中,全球顶尖AI模型均翻车。冠军Gemini 2.5 Pro仅得31分,连铜牌都拿不到。Grok - 4表现糟糕,DeepSeek - R1也令人失望。AI虽有思路,但逻辑细节不足,离成奥数大师尚远。

新智元
开源动态8

体编程“小钢炮”:Qwen3.6-35B-A3B开源!

Qwen3.6-35B-A3B开源,是稀疏MoE模型,总参350亿、激活参数30亿,轻量高效,在智体编程等方面表现卓越,超越前代,可与稠密模型媲美,支持多模态,已在Qwen Studio上线并发布开源权重。

千问大模型
算法论文8

RL训练一层就够了!单层RL超越全参数训练,跨任务跨模型跨算法全部验证

明尼苏达大学、北大和亚马逊团队研究发现,RL收益集中在中间层,训练单层可超全参数训练。他们提出层贡献度指标,经多模型、算法、任务实验验证,还给出三种训练优化策略。

机器之心
新闻资讯7

刚刚,苹果WWDC掀AI重构风暴!端侧模型全开放、AI版Siri却成最大「鸽」王

北京时间今天凌晨,苹果全球开发者大会 WWDC 召开。苹果宣布系列系统更新,展示 AI 融入产品计划,开放端侧大模型,推 Xcode 26。但增强版 Siri 跳票,股价下跌,网友不满。

机器之心
新闻资讯8

定义RAG新基准?谷歌发布 Gemini Embedding 2:首个原生多模态嵌入模型,延迟骤降70%

谷歌昨夜推出首个基于 Gemini 架构的原生多模态嵌入模型 Gemini Embedding 2,通过 Gemini API 和 Vertex AI 向开发者公开预览。它可将多类型数据映射到统一嵌入空间,多项基测排名第一,还获早期合作伙伴高度评价。

InfoQ
产品应用8

GitNexus:GitHub一周暴涨6000星!这个"零服务器代码神器"让AI终于看懂你的代码了

GitNexus是零服务器代码智引擎,将GitHub仓库或ZIP文件转为交互式知识图谱,让AI看懂代码依赖。它有知识图谱构建等功,支持多语言,适用于接手项目、代码审查等场景。

小华同学ai