评测机制」共找到 1467 篇相关文章

算法论文7

SGLang Custom AllReduce v1 与 v2 实现原理详解

文章聚焦 SGLang 里两代自定义 all-reduce 实现(v1 和 v2),前者从 vLLM 移植,后者是默认版本。详述其负载特征、前提条件、分发链、同步机制、算法及 CUDA graph 支持等内容,还对比了两代差异,并提及相关环境变量。

GiantPandaLLM
算法论文7

Anthropic最新研究:Claude存在神秘J空间,与人类心智高度相似

Anthropic研究团队在Claude中发现类似人类大脑工作机制的J空间,它存在于模型神经激活中,能让模型默默思考。失去J空间Claude在多步骤推理任务表现变差,还可暴露模型意图,团队已创建演示工具JLens。

AI寒武纪
产品应用8

4秒出百万面!突破千万面精度+12K高清贴图,手握数亿的3D生成公司下一局怎么打?

影眸科技旗下Hyper3D受英伟达青睐。该司完成数亿元融资,发布全新模型Hyper3D Rodin Gen - 2.5,引入类LLM的Thinking机制,4秒生成百万面级模型,还突破千万面精度,搭配12K原生3D贴图模型。

量子位
新闻资讯8

「10万小时人类数据」不搞对齐只靠规模,灵初智能Psi-R2登顶MolmoSpaces!

4月10日晚,灵初智能发布大模型、数据集与合作计划,包括策略模型Psi - R2、世界模型Psi - W0及近10万小时人类操作数据。其未走花哨对齐路线,靠系统协同,在MolmoSpaces评测中表现优异,体现自主研发路线先进性。

机器之心
推荐文章8

LlamaIndex 深度实战:用《长安的荔枝》学会构建智能问答系统

文章兼顾 RAG 科普与 LlamaIndex 实战。介绍 RAG 原理,用《长安的荔枝》讲解关键步骤和参数。实战部分展示用 LlamaIndex 搭建问答系统,代码量少。优化篇通过实验给出参数调优建议,架构篇剖析内部机制,最后提及 Agent 化拓展功能。

阿里云开发者
8

刚刚!Kimi Linear横空出世,全新注意力架构:1M长文本解码速度飙升6.3倍,KV缓存砍掉75%

月之暗面推出全新注意力架构Kimi Linear,有望成下一代Agent LLM基石技术。它解决了LLMs处理长序列任务的瓶颈,性能超传统机制,还开源了核心代码。Kimi Linear的KDA模块提升了表达和硬件效率,实验表现佳。

AI寒武纪
算法论文7

AI能否「圣地巡礼」?多模态大模型全新评估基准VIR-Bench来了

来自日本高校和企业团队提出多模态大模型评估基准 VIR-Bench,用于评测 AI 对旅行视频中地理位置与时间顺序的理解。它将任务拆解,构建数据集,实验显示模型虽有改进但性能远未达标,指明了大模型进化方向。

机器之心
开源动态8

快慢思考不用二选一!华为开源7B模型实现自由切,精度不变思维链减近50%

华为发布openPangu-Embedded-7B-v1.1,参数7B却有双重“思维引擎”。采用渐进式微调策略和快慢思考自适应模式,可自由切换快慢思考,在多评测中精度提升,思维链减近50%。还推出openPangu-Embedded-1B小模型。

量子位
开源动态8

Google开源MCP数据库工具箱轻松连接各类数据库

近日Google开源新项目genai - toolbox,它是为数据库设计的MCP服务器,能让开发者用不到10行代码将数据库工具集成到AI应用。该项目封装复杂问题,有动态工具注册机制,支持主流数据库,提供多语言SDK和多种部署方式。

AI工程化
开源动态8

MiniMax开源首个视觉RL统一框架,闫俊杰领衔!推理感知两手抓,性能横扫MEGA-Bench

MiniMax开源首个视觉RL统一框架V-Triune,由闫俊杰领衔。该框架通过三层组件设计和动态IoU奖励机制,让VLM能联合学习推理和感知任务。还开发Orsta模型系列,在MEGA - Bench表现出色,且MiniMax多模态布局动作多。

量子位