「系统架构思维」共找到 3454 篇相关文章
DeepSeek-R1推理智能从哪儿来?谷歌新研究:模型内心多个角色吵翻了
谷歌等机构研究指出,推理模型能力提升源于‘思维社会’,即模拟类多智能体交互结构。如 DeepSeek - R1 等在推理中展现高视角多样性,对话特征能提升推理准确率,还提出利用‘群体智慧’新方向。
阿里发了个简历AI神器,大小仅0.6B
阿里巴巴集团研究团队开发出基于布局感知的简历解析框架,在简历解析任务准确率逼近Claude - 4等顶尖大模型,处理仅需1 - 2秒,直击自动化简历解析痛点,已在阿里HR系统全面部署。
CuteDSL-1: Introduction
文章介绍CuteDSL,它因Cutlass编译慢、调试难等痛点而生,可在Python构建DSL,编译快、调试易且性能无损。文中阐述其架构、使用方法、与PyTorch集成优势等,还提及基于CuTe的开发及性能对比。
上海AI Lab、浙大EagleLab等提出RRVF:利用「验证非对称性」,只输入图片学习视觉推理
上海AI Lab、浙大EagleLab等联合完成研究,提出RRVF框架,利用「验证非对称性」,仅输入图片学习视觉推理。它构建闭环系统,通过迭代推理、视觉反馈等步骤训练模型,实验显示效果佳,证明验证法则力量。
突发!Jason wei也被小扎挖走了
Jason wei是OpenAI研究科学家,是思维链、强化学习研究重要推动者,2023年2月加入OpenAI,此前在谷歌大脑工作。他和HYUNG Won Chung一同被小扎挖走,二人是o系列模型及测试时间计算重要推动者。
Agent性能暴涨90%,刷榜GAIA可太容易了~
今年AI Agent层出不穷,当前研究缺乏统一标准、复现难。oppo Agent团队分享构建高效Agent的关键组件及刷榜GAIA的方法,从事实获取能力和逻辑推理保真度两维度分析,介绍了强化感知和提升思维的策略。
Qwen3家族训练秘籍公开:思考/非思考融进一个模型,大模型蒸馏带动小模型
Qwen3技术报告揭晓8款模型关键技术,采用双模式架构,训练和微调分段进行,还“大带小”蒸馏数据。其融合思考与非思考模式,训练分多阶段,Qwen Chat还全量上线深度研究功能。
从多模态大模型中「拆」出音频向量模型
Google 发布原生多模态向量模型 Gemini Embedding 2,推动 Omni Embedding 发展。Jina AI 团队分享从多模态大模型中「拆」出音频向量模型的经验,介绍架构、训练数据,对比四种做法,还提及评测、应用场景及结论。
罗福莉携小米MiMo-V2-Flash首次亮相:一次在推理与Agent上的下注|甲子光年
大模型进入新阶段,效率成能力一部分。小米MiMo团队12月16日晚发布并开源MiMo - V2 - Flash,负责人罗福莉首亮相。该模型在推理、编程和智能体场景表现出色,在架构、训练方法等有创新。
开发者把掌舵人骂到关回复!Windows 要变成“Agent OS”?这位印度裔高管遭遇大型翻车现场
微软高管 Pavan Davuluri 宣传 Windows 将演变为 Agentic OS,推文评论区却被批评淹没,他无奈关评论。微软正推动 Windows 向 AI 驱动转型,可开发者和用户更想要稳定系统,对 AI 改造不满。