「新范式」共找到 4084 篇相关文章
DeepSeek悄悄开源LPLB:用线性规划解决MoE负载不均
昨天,DeepSeek 在 GitHub 上线新代码库 LPLB 解决 MoE 负载不均。它利用线性规划算法优化专家并行工作负载分配,能处理动态波动,但也存在忽略非线性成本等局限,对 MoE 架构训练加速有参考价值。
啊?微博7800美元训的大模型,数学能力超了DeepSeek-R1
近日,微博发布自研开源大模型VibeThinker,15亿参数却在数学测试上击败6710亿参数的DeepSeek R1,后训练成本仅7800美元。其为AI产业带来新思考,还将推动微博AI应用发展。
AutoDev Review Agent:应对 10 倍代码量的 Agentic 代码审查
文章介绍 AutoDev 的新 Agent——基于多端架构的 Code Review Agent,应对 Vibe Coding 时代 10 倍代码量审查压力。它采用 Agentic 多步骤审查,能在多端运行,串联多环节,虽有不足但奠定自动化审查基础。
颠覆传统认知!顶尖架构师眼中,决定职业生涯上限的不是技术能力|独家对话一线架构大佬 Christian Ciceri
在软件开发与AI浪潮融合背景下,架构师面临新挑战。InfoQ采访Apiumhub联合创始人Christian Ciceri,探讨‘可度量、可演化的架构’理念及AI影响,Ciceri强调AI辅助而非替代人,架构需团队共创。
上交×蚂蚁发布 DiagGym:以世界模型驱动交互式医学诊断智能体
上海交通大学与蚂蚁集团等团队提出新训练框架,构建面向医学诊断的世界模型DiagGym,训练诊断智能体DiagAgent,还设计评测基准DiagBench。实验显示该框架下的智能体表现优于先进模型,代码等已开源。
谢赛宁×李飞飞×LeCun首次联手!寒武纪-S「空间超感知」AI震撼登场
Yann LeCun、李飞飞和谢赛宁联手发布论文「Cambrian - S:迈向视频中的空间超感知」。他们认为LLM虽能力强,但无法像人类一样感知世界,为此构建Cambrian - S系列模型,开源相关数据和模型,还开发了新原型。
告别盲目卷参数!科大讯飞1024亮出底牌:all in“更懂你”
在模型能力趋同当下,科大讯飞在1024开发者节提出让AI“更懂你”。展示多模态超拟人“小飞老师”和「百变声音复刻」功能,发布星火X1.5大模型,还推出多领域软硬件产品,赋能多行业。
AI 巨头对话:Sam Altman 与 Satya Nadella 论 AI 未来、算力与微软王牌
OpenAI的Sam Altman和微软的Satya Nadella在播客中探讨AI未来等话题。涉及1.4万亿算力投入、微软与OpenAI新合作协议细节,指出瓶颈在数据中心和电力,还谈及AI经济模型、未来愿景等。
【DeepSeek-OCR系列第一篇】Language Modelling with Pixels【ICLR23】
当前主流语言模型依赖固定词表,扩展到多语言、多脚本时面临覆盖受限、计算昂贵、鲁棒性差等问题。ICLR 2023论文提出不依赖词表的PIXEL模型,通过将文本变成图像用视觉Transformer理解,实验验证其有跨语言、抗噪声等优势。
开源大模型SOTA又刷新!中国MiniMax M2全球排名第五,开源榜一
中国AI独角兽MiniMax发布模型M2,刷新开源SOTA。它采用混合专家架构,平衡了智能、速度和成本。在多个权威测试中表现优异,价格仅为Claude 3.5 Sonnet的8%,还提供多种部署方式和限时免费服务。