性能测评」共找到 2036 篇相关文章

算法论文8

多模态幻觉的病因「高熵节点」找到了!全基准幻觉率下降

多模态大推理模型的幻觉常出现在生成转折词时,此时模型处于高熵关键节点,易脱离图像证据。研究者提出LEAD,高熵时保留候选推理方向,注入视觉锚点拉回证据,实验显示它能跨领域提升模型性能

新智元
开源动态8

蚂蚁具身智能明牌了:做大脑,和宇树们错位竞争

蚂蚁灵波开源具身智能基座模型LingBot-VLA,用20000小时真实世界数据训练,解锁最大规模开源真机数据之一。它性能超国际顶尖模型,还指明通用具身智能发展路径,为行业提供全栈解决方案。

量子位
开源动态7

超强开源OCR,手写体识别能力超dots.ocr,封存多年的老文档数字化有救了。

文章推荐新开源的OCR系统Chandra,它对手写体识别做了优化,官方测评数据显示比dots.ocr强。介绍其适用于多场景及功能特点,还展示了不同场景的识别效果,建议有需求者多对比测试。

开源AI项目落地
推荐文章7

OCR-Reasoning:揭秘多模态大模型在复杂图文推理中的真实能力

主流OCR评测基准聚焦信息抽取任务,而图文推理任务缺乏系统性评估标准。OCR - Reasoning可系统性评估多模态大模型深度推理能力,还给出多种推理示例,并展示了测评Qwen2.5 - VL - 7B模型的代码。

PaperAgent
算法论文7

经典ReLU回归!重大缺陷「死亡ReLU问题」已被解决

在深度学习领域,经典 ReLU 函数因简洁性等优势受青睐,但有「死亡 ReLU 问题」。德国吕贝克大学等机构研究者引入 SUGAR 方法,不牺牲 ReLU 优势解决该问题,还设计 B - SiLU、NeLU 函数,实验显示性能提升显著。

机器之心
算法论文7

模型宣称的“百万字处理能力”是真本事,还是营销噱头?LongCodeBench揭露真相

近年来大模型号称有百万字处理能力,但这是真本事还是噱头存疑。论文用LongCodeBench测评工具揭开长上下文模型真实表现,测试顶尖模型发现长文本能力‘翻车’,还分析了长上下文难的原因及面临的瓶颈。

深度学习自然语言处理
产品应用7

Apple 终于承认了:Mac mini 正在变成一台 Agent 服务器

苹果偷摸发布新 Mac mini,处理器升级到 M6 和 M5 Pro,官方将其置于 Agent 常驻使用场景,产品边界向 Agent 服务器延展。新款性能提升显著,Mac Studio 也有强大配置,Apple 产品线朝本地 AI 计算基础设施转变。

MacTalk
产品应用8

击败GPT、Gemini,复旦×创智孵化创业团队「模思智能」,语音模型上新了

近日,由复旦邱锡鹏担任首席科学家的模思智能发布多说话人自动语音识别模型 MOSS - Transcribe - Diarize,性能超 GPT - 4o、Gemini 等。它解决语音领域落地痛点,跑分亮眼,还解决 SATS 方案不足,开放 API 限时免费。

机器之心
新闻资讯7

万卡时代,企业需要怎样的算力集群?

过去两年,AI算力需求跃升,消耗从训练主导转向推理驱动。企业算力需求有突发性等特点,智算集群是关键方案。InfoQ联合腾讯云发起直播探讨,还介绍了算力供给缺口、集群构建交付、性能优化及演进方向。

InfoQ
推荐文章7

TileLang深入详解-第三章-Kernel,Buffer,并行控制和矢量化

文章详细介绍TileLang核心编程构造,包括Kernel函数、Buffer和并行控制等。阐述其计算定义、并行与循环控制方式,还提及性能优化的矢量化访存,给出代码示例,并分享源码里形状、并行域和线程的最佳实践。

GiantPandaLLM