HLL 评测基准」共找到 1324 篇相关文章

新闻资讯7

谷歌智能体发力:增强版Gemini Deep Research和专属API都来了

OpenAI强势更新,谷歌也没闲着。正式发布增强版的Gemini Deep Research,配套推出DeepSearchQA基准测试集,还发布了Interactions API,这不仅是Deep Research升级,还是Gemini生态的大升级。

量子位
开源动态8

Insanely Fast Whisper:开源社区让音频转录速度提升19倍

Insanely Fast Whisper工具将OpenAI Whisper转录速度提升19倍,采用Flash Attention 2技术,零质量损失。它集成多语言支持、说话人分离等实用功能,还支持跨平台,免费运行。最初是基准测试demo,值得音频处理用户关注。

AI工程化
开源动态7

OpenClaw长期记忆:优秀管线与玄学效果

文章拆解 OpenClaw 记忆系统全链路,指出其虽设计理念好,但记忆效果不稳定。介绍 RDSClaw 记忆插件如何补强,该插件与原生系统协作,提升记忆稳定性,在 LoCoMo10 评测中成绩显著。

阿里云开发者
开源动态8

Lumina-DiMOO:多模态扩散语言模型重塑图像生成与理解

上海人工智能实验室推出多模态扩散语言模型 Lumina - DiMOO,它基于离散扩散建模,打破多模态任务壁垒。相比传统自回归架构模型,它解决了生成慢、质量受限等问题,在多项评测中夺魁。

机器之心
产品应用8

大涨240%,Doc-Researcher确立多模态文档深度研究新范式

在ChatGPT引领的AI革命中,大语言模型面对专业复杂文档常“束手无策”。Doc-Researcher提出三位一体解决方案,构建M4DocBench评测,性能远超现有方案,还适用于多产业场景。

PaperAgent
算法论文8

你的 AI 助理一闭嘴就在「发呆」?上交大 ProAct:把 Agent 的空闲时间变成生产力

上海交通大学 APEX 实验室提出 ProAct 架构,能把对话空闲时间转化为主动准备机会。它有预测、筛选、交付三级流水线,经 ProActEval 评测效果佳,证明算力用对地方更重要,让 Agent 能提前为用户准备。

AI科技评论
开源动态8

打破瓶颈,让RAG学会思考:中科大、智源等发布推理检索框架BGE-Reasoner

人工智能浪潮下,推理密集型信息检索是RAG和AI Agent技术发展瓶颈。中科大、智源等机构联合研发推理检索框架BGE - Reasoner,在BRIGHT基准测试中刷新纪录,还将开放相关代码等推动研究。

机器之心
推荐文章7

TileLang深入详解-第一章-GPU 体系结构复习

作者借长假学习 TileLang 并撰写此文,先复习 GPU 体系结构,包括计算与线程组织、存储层次、专用指令单元,接着介绍核心性能模型与优化原理,最后给出基于 TileLang 的基准测试实践。

GiantPandaLLM
产品应用7

Qwen3.6-Max-Preview来了!

继Qwen3.6 - Plus发布,推出Qwen3.6 - Max - Preview预览版,相比前者有更强世界知识、指令遵循能力,智能体编程表现显著提升。可在Qwen Studio交互,也将通过阿里云百炼API调用。

千问大模型
算法论文8

没想到,又一个Code Agents瓶颈,被美团&上交大彻底撕开了~

AI写代码能力提升,但打分方法僵化且成本高。上交大与美团论文提出新基准PRDBench,让AI出题人审核,还训练裁判PRDJudge,提升打分准确率与稳定性,促使AI学会‘看懂需求’。

PaperAgent