「在离线混部」共找到 8177 篇相关文章
重构开发体验:CodeFuse 智能代码助手的设计与实践
蚂蚁集团技术专家牛俊龙在 QCon 大会分享 CodeFuse 智能代码助手架构设计与实践,介绍本地核心服务设计策略,结合案例优化其 AI 能力,还分享落地经验、教训与未来发展路径。
刚刚,OpenAI 称中国公司智谱让其感到害怕
OpenAI在官方博客发文《Chinese Progress at the Front》,点名中国AI公司智谱,称其在全球AI竞赛中取得显著进展,是真正值得关注的中国AI公司,智谱正快速向全球扩张。
99% 确定:OpenAI Dev Day 将发布可视化 AI 工作流工具,“AI Fabric”成为新的关键词
全网传 OpenAI 将在 Dev Day 发布类似 n8n、dify 的 Agent Builder,TestingCatalog 试用称其为‘最流畅的 Agent 构建画布’。它能让开发者在统一界面操作,或影响自动化工具市场。
一场「狼人杀」,考倒了一堆大模型
南开大学等机构设计 InMind 评测框架,在 Avalon 游戏对 11 个前沿大模型测试。多数模型停留在表层模仿,仅少数推理增强模型有初步‘风格敏感性’,未来人机交互应关注‘像不像’。
破解「个性化学习」长尾难题,巧用神经坍缩理论 | ICML 2025
当前个性化学习方法基于数据高质量且类别平衡的假设,但现实教育数据呈不均衡分布。华东师范大学和浙江大学团队在ICML2025提出NCAL方法,将神经坍缩理论引入该领域,解决教育数据长尾分布问题。
Meta Shuffling的MoE Grouped GEMM kernel benchmark
作者拷贝fbgemm开源的moe grouped gemm kernel,修复小bug后与SGLang的Grouped GEMM Triton Kernel对比,结果显示fbgemm在MoE模型上性能提升显著,可应用到SGLang的ep - moe的grouped gemm kernel中。
阿里Qwen3一口气开源多个向量&排序模型,冲!
今天阿里正式开源Qwen3-Embedding和Qwen3-Reranker系列,为多语言文本嵌入和相关性排序树立新标杆。提供0.6B/4B/8B三种版本,支持119种语言,在多个数据集达先进性能,赋能多种应用场景。
微软开源全新Agentic网络项目:NLWeb
微软在Build大会宣布五件大事,4件与Agent有关,包括升级GitHub Copilot、Copilot调优等。还开源新的NLWeb项目,可让用户用自然语言与网站交互,有望在代理网络中扮演类似HTML的角色。
“心内推理”:一种动态多模态潜在空间推理范式 | 直播预约
当前多模态大模型推理效率低、稳定性不足。本次分享将介绍DMLR,它无需额外训练,仅在推理阶段生效,通过在潜空间优化潜在思考token、引入关键视觉信息,实现高效稳定的多模态推理。
刷新复杂Agent推理记录!阿里通义开源网络智能体超越DeepSeek R1,Grok-3
互联网信息检索中,复杂问题让普通开源模型力不从心。阿里通义实验室提出WebSailor方案,通过SailorFog - QA数据集和DUPO算法等创新,提升模型能力,在多基准测试中超越诸多开闭源模型。