技术评估」共找到 3421 篇相关文章

开源动态8

探索文本压缩极限!C3纯文本压缩pipeline:20倍压缩解码准确率98%

DeepSeek团队的DeepSeek - OCR技术引发关注,研究者重新审视视觉压缩路径后提出C3技术。C3采用纯文本压缩管道,实验表明其压缩精度远超DeepSeek - OCR,还具独特遗忘模式,代码模型均已开源。

AINLPer
开源动态8

沉寂一个月,openPangu性能飙升8%!华为1B开源模型来了

华为发布专为昇腾端侧硬件打造的openPangu Embedded - 1B模型,仅10亿参数却性能卓越。它运用多阶段训练和优化,在权威基准表现亮眼,V1.1平均分较上月跃升超8%,还介绍了背后技术

机器之心
算法论文7

CodeClash 通过多轮编程竞赛对大型语言模型进行基准测试

评估大型语言模型(LLM)编码能力,斯坦福、普林斯顿和康奈尔研究人员开发 CodeClash 基准测试,让多个 LLM 在多轮比赛中较量,涉及多种代码竞技场,还评估模型分析代码库能力,未来将处理更大代码库。

InfoQ
新闻资讯7

不造芯片的IBM把制程推到0.7nm!指甲盖大小芯片集成近1000亿晶体管,半导体底层物理有望突破

当地时间6月25日,IBM发布全球首个亚1纳米芯片技术0.7纳米节点,晶体管密度翻倍,性能和能效大幅提升。该技术源于纳米堆叠架构,若5年内量产有望革新AI芯片架构,但量产面临诸多挑战。

DeepTech深科技
新闻资讯8

讯飞刚发的财报:净利润暴涨了202%

科大讯飞2025年第三季度财报亮眼,营收、利润、现金流全面转正,归母净利润同比大增202%。AI大模型技术突破与产业化落地成业绩修复关键,在技术、业务、生态方面成效显著,还将加大研发投入。

量子位
新闻资讯7

GPT-5仅23.3%,全球AI集体挂科!地狱级编程考试,夺金神话破灭

最新基准测试SWE-Bench Pro评估AI编程智能体,直面真实企业级工程任务。顶尖模型几乎溃败,GPT - 5仅23.3%。该测试解决现有基准数据污染、任务简单问题,能成未来LLM编码能力标尺。

新智元
算法论文8

北大发布学术搜索评测ScholarSearch:难倒一众DeepResearch的“开卷考试”

北京大学DS - Lab发布ScholarSearch,这是评估大语言模型学术检索能力的数据集,含223道高难度题目。评估显示现有模型表现欠佳,纯推理模型准确率低,有搜索功能的模型虽有提升但仍不足。

量子位
算法论文8

好看不等于会交互!阿里发布基于交互的世界模型基准

阿里等联合推出 Omni - WorldBench 评估框架,指出多数高颜值 AI 视频在物理规律和交互逻辑上有缺陷。该框架含提示词套件和量化评估框架,对 18 款模型测评,为 4D 世界模型研发指明方向。

AIGC开放社区
开源动态7

给 OpenClaw 装上“全网眼睛”:我把这个 3K+ Star 项目果断集成到了个人skills里。

作者用OpenClaw /Claude Code读推特遇难题,各平台上网关卡多。后发现开源2天获1.1K Star的Agent - Reach项目,将上网工具统一打包,技术选型实用,强调AI时代想法和判断力比技术重要。

AI进修生
产品应用8

真·全民AI健康管家来了!实测蚂蚁AQ:追问识药看皮肤,还能连医院接硬件

蚂蚁上线AI健康管家APP——AQ,有超百项AI功能,连接超5000家医院、近百万医生等。它能追问识药看皮肤,打通硬件,设语音通话。凭借技术和生态优势,实现从技术工具到健康管家的跃迁。

量子位