HLL 评测基准」共找到 1324 篇相关文章

开源动态7

月之暗面硬刚Anthropic!开源万亿参数Kimi K2,Agent编码性能直逼闭源最强!

上周五月之暗面发布并开源万亿参数Kimi K2,外网评价高。它或开启开源AI的“Agentic时代”,在智能体和编码基准上表现出色,成本远低于竞品,但推理速度较慢,已可平替Claude。

探索AGI
开源动态8

首发 | 陈天桥盛大团队,推出最强开源记忆系统EverMemOS

EverMind团队发布面向人工智能智能体的长期记忆操作系统EverMemOS。它在主流评测集表现超此前工作成新SOTA,受人类大脑记忆机制启发设计,有四层架构和三大特点,已开源,后续将推云服务。

机器之心
开源动态8

开源!强效果,高性能,严隐私?我全都要:OPPO 终端大模型实践

OPPO AI 中心推出开源端侧多模态大模型 AndesVL,含 0.6B - 4B 四档尺寸套件,有通用能力强等优势。它经多阶段训练,OPPO 还构建端侧部署方案,评测显示其在多方面表现优异,未来会继续技术革新。

InfoQ
新闻资讯8

Cursor终结者?Grok 4正式登顶!马斯克扬言编程碾压,20万N卡年赚47亿美金!

时隔5个月,xAI发布通用模型Grok 4,后续还将推编码、多模态代理和视频生成模型。Grok 4已上线,有三个订阅版本。马斯克称其智能超博士生,在多基准测试中领先,编码或超Cursor。

InfoQ
新闻资讯7

GPT-5.6 Sol暴涨3倍,OpenAI最强视觉AI登顶!

第三方评测机构Roboflow测试显示,GPT-5.6 Sol在目标检测、计数等视觉任务上表现出色,尤其在文档版面识别和密集场景处理上进步明显,但认字能力有退步,且大尺寸图片检测框易飘移。

新智元
开源动态7

DeepSeek R1 迎来小更新大升级,性能直逼 OpenAI o3!

昨日,DeepSeek 发布 R1 大模型最新版本 DeepSeek - R1 - 0528 并开启公测。虽官方未附详细技术说明,但用户反馈推理和输出有改进,也有性能方面的不同看法,其在基准测试表现佳。

AI科技大本营
开源动态7

DeepSeek-R1今天一次「小更新」,颠覆了大模型格局,网友:尽快放R2

昨晚,DeepSeek官方宣布其R1推理模型升级到最新版本(0528),并公开模型及权重。该版本参数量高达6850亿,采用MIT许可证,性能提升明显,在多个基准测试中成绩优异,网友实测代码能力也大幅提升,但仍存在过度思考问题。

机器之心
新闻资讯7

鼠标的未来是手环?解码肌肉信号,Meta黑科技登上Nature

Meta推出非侵入性神经肌肉交互系统,利用手腕表面肌电图(sEMG)实现人机交互,该技术登上7月24日的Nature。实验在连续手势控制、离散手势控制和打字三个任务评测效果不错,适合特殊人群,也能弥补脑机接口数据不足。

新智元
算法论文8

都在卷「让大模型多循环几遍」,这个7B模型LoopCoder v2说:多循环 1 次就够了

一项新研究表明,7B小模型LoopCoder v2在正常计算外多循环一次,就能在SWE - bench Verified基准上大幅提分。继续增加循环次数,性能反而下降。研究还算了‘收益 - 成本’账,给出选择循环次数的诊断方法。

AIGC开放社区
产品应用8

全球AI双榜第一!力压谷歌Veo与Grok,Vidu Q3「参考生」之王归来

这个月初谷歌免费开放Veo 3.1视频生成能力,让AI视频更普及,但模型距‘能交付’仍有差距。Vidu Q3带着‘全家桶’回归,覆盖多领域,在权威评测榜单成绩优异,视觉、听觉和场景能力升级。

新智元