「评测机制」共找到 1466 篇相关文章
21
本文聚焦vllm v1中管控模型分布式推理的核心Executor部分,介绍其4种类型及适用场景,以mp类型为例阐述Executor - Workers架构,还说明了大小数据在两者间的传输机制及原理。
没有全科优秀,具身模型别想进入百万小时
文章介绍权威评测 RoboDojo,给全球机器人模型办‘高考’,多数具身模型离落地远。原力灵机的 DM0.5 模型登顶,它记忆能力强、全科优秀,且全面开源,有望推动具身智能发展。
登顶SuperCLUE DeepSearch,openPangu-R-72B深度搜索能力跃升
近日 SuperCLUE 发布 11 月 DeepSearch 评测报告,国产大模型 openPangu - R - 72B 名列第一。它采用 MoE 架构平衡效率与性能,经预训练技术优化和 DeepSearch 专项突破,彰显国产算力与大模型研发融合成效。
人人都能炼专属Agent,上海交大开源端侧Agent全栈工具链,真实场景性能超GPT-5!
上海交大开源端侧Agent全栈工具链MobiAgent,将构建手机Agent全流程开放。它在真实场景性能超GPT - 5,还设计“潜记忆加速器”,通过三步养成Agent,评测表现出色,降低移动智能体开发门槛。
OCR-Reasoning:揭秘多模态大模型在复杂图文推理中的真实能力
主流OCR评测基准聚焦信息抽取,复杂图文推理任务中多模态大模型深度推理能力缺乏评估标准。OCR - Reasoning可系统性评估,还列举多种推理示例,并测评了Qwen2.5 - VL - 7B模型。
完全开源的7B模型,性能比肩主流LLM,训练成本仅16万美元,复现DeepSeek的强化学习!
Moxin-7B由多机构团队联合开发,遵循“开源科学”原则,公开全流程细节。它训练成本仅16万美元,评测表现亮眼,在架构、数据策略、训练过程等方面有创新,为中小企业提供可控AI方案。
人多不管用!智能体团队别盲目扩张,最新综述给出三大维度
随着大语言模型驱动的多智能体系统快速发展,核心问题是有些系统规模扩大后会失稳、低效。美国、英国和澳大利亚研究人员提出三维分类框架描述大规模智能体网络,指出真正决定系统表现的是三种机制组合。
提速79%!上交大新方法优化企业级AI流程调度 | IEEE ICDCS’ 25
上海交通大学朱怡飞教授团队联合江行智能提出调度框架LLMSched,解决复合LLM应用任务运行时长和结构不确定问题。该框架重构DAG模型,用贝叶斯网络和熵减机制优化调度,实验显示最多降79%平均任务完成时间。
手握1000项专利的“药物狂人”,为何在AI制药时代选择逆行?
手握约1000项专利的再生元联合创始人乔治·扬科普洛斯,在AI制药成热点时选择逆行,坚持内部研发、人类遗传学和基础生物学。他批评跟风,强调深入理解疾病机制,认为AI可增效但不能决定方向。
伦理防线不可靠!分布偏移诱导,大模型进入暗黑模式
香港理工大学与西北工业大学联合研究指出,当前大语言模型对齐机制仅实现表层合规,预训练时内化的有害知识仍潜藏。遇数据分布偏移,模型“黑暗模式”易被激活。26个主流模型中22个在攻击下失效,凸显现有范式缺陷。