K2.5模型」共找到 9186 篇相关文章

8

GPT-5.5 Instant上线:幻觉减少52.5%,告别废话

OpenAI完成ChatGPT默认模型的静默升级,GPT-5.5 Instant全面替换GPT-5.3 Instant。它在数学推理、减少幻觉、精简回答、记忆功能等方面有显著改进,还采用灰度推送策略。开发者认为其定位是日常场景够用顺手。

AI工程化
开源动态8

蚂蚁C2LLM:基于注意力池化的代码检索新范式

在Code RAG场景中,传统文本Embedding模型处理代码表现欠佳。蚂蚁集团与上海交通大学联合发布C2LLM系列模型,引入注意池化模块,在MTEB - Code榜单表现出色,还得益于优质训练流程,成果已回馈社区。

PaperAgent
开源动态8

马斯克掀桌子了,最强开源大模型诞生!Grok-2近万亿参数性能首曝

xAI官宣向所有人开源Grok - 2,其有9050亿参数、128k上下文窗口等强大技术规格。还梳理了开源部分、技术特点、权限等,介绍使用方法,网友和大佬高度评价,马斯克预告后续计划。

新智元
算法论文8

揭示扩散语言模型扩展定律,人大高瓴团队与蚂蚁集团发布LLaDA MoE v2

中国人民大学高瓴人工智能学院与蚂蚁集团合作,首次系统刻画混合专家扩散语言模型扩展定律,据此训练LLaDA MoE v2,实现扩展效率与智能双重突破,将推动其迈向规模化时代。

机器之心
产品应用7

老黄亲自站台,英伟达编程神器!Cursor 2.0自研模型狂飙4倍

Cursor 2.0版本重大升级,发布自研编码模型Composer,速度是同等模型4倍。还重构IDE交互逻辑,支持多智能体模式,引入语音模式等。早期测试和开发者反馈其速度快,但智能程度与部分模型有差距。

新智元
新闻资讯7

3B小模型,编程得分比肩Opus 4.5,神秘模型引发热议,原是国产

最近,3B小模型VibeThinker - 3B在X上火了,它在编程等推理任务上比肩前沿大模型,体积却小很多。它是国产模型,来自新浪微博团队,在各项基准测试表现出色,不过在通用知识领域表现欠佳。

机器之心
产品应用8

智源悟界 · Emu3.5 重塑世界模型格局:首提多模态 Scaling 范式,AI 理解世界再进化

北京智源研究院发布大规模多模态世界模型“悟界·Emu3.5”,它能模拟复杂动态物理世界,揭示“多模态Scaling范式”。该模型继承深化Emu3技术哲学,在多方面有提升,为世界模型领域提供进化路线。

AI科技评论
推荐文章7

8种LLM架构设计大比拼:从 DeepSeek-V3 到 Kimi K2,究竟有啥不同

文章对比了8种LLM架构设计,如DeepSeek-V3、OLMo 2等。介绍各模型关键技术,像DeepSeek-V3的多头潜在注意力和混合专家架构,还分析不同设计对性能、效率的影响,助读者了解LLM架构差异。

CourseAI
算法论文8

模型用不好Skill?新范式让模型学会Skill的底层逻辑,3B模型推理token省5倍,性能反超

浙江大学联合美团龙猫团队、清华大学推出SKILL0,提出技能内化思路。它在训练中引入关键机制,让小模型把技能内化到参数里。实验显示,其效果出色,token效率高,为小模型成领域专家提供新方向。

量子位
新闻资讯7

GPT-5的所有传言,以及,Sora 2?

OpenAI今晚1点举办直播,GPT - 5将亮相。发布前关键信息汇总,包括直播时长变长、GitHub泄露四个版本、三档定价策略、突破人类基准测试等,还或同步发布Sora 2。

AGI Hunt