结构化评估」共找到 1779 篇相关文章

新闻资讯7

先验+后验加持,大模型能否 hold 住推理预测的现实「溢出」?

多数大模型评估基准依赖固定数据集,难测真实推理实力。字节跳动等推出的 FutureX 动态评测基准,将重点移至动态预测能力。实验显示不同模型在不同任务表现有别,大模型在现实场景运用仍待优

机器之心
推荐文章7

到底是谁在推崇 Nature、Science?——一场跨学科评价体系的结构性误解

文章指出不同学科对 Nature、Science(N/S)态度差异大,基础学科不看重,应用学科推崇。原因在于学科生态差异,N/S 是传播器,下游学科需其传播成果,大奖评价与 N/S 体系不同,国内不应将其‘工具’。

力学与人工智能
产品应用8

打造4大“AI龙虾” 军团,才懂钉钉为何是企业数智的最佳答案

企业数智喊了多年却鲜有成功,多数企业面临技术门槛高、系统不通、数据孤岛等问题。把Copaw这个AI Agent接入钉钉,运行了写日报、商机搜寻、A股财报分析、电商数据整理分析四个案例,展现了钉钉平台优势,是企业数智有效解法。

鲸选AI
新闻资讯7

网民票选AI王者,LMArena一夜变17亿美元独角兽!

LMArena原是校园开源小项目,从2023年起步,如今估值达17亿美元。其Arena模式让网友盲投选AI,Elo评分系统算排名。虽有众包投票易操纵等争议,但已成行业标杆,还将为大厂提供付费评估服务。

新智元
产品应用8

AI时代CRM的重生之路:阿里云上的Salesforce如何改写SaaS规则?

AI 浪潮下传统 CRM 面临效率、合规与智能融合等问题。阿里云上的 Salesforce 展出“中国定制 AI CRM”方案,历经六年探索,从合规、生态到 AI 闭环构建能力,通过多行业实践重塑企业增长逻辑,为 SaaS 行业提供范本。

AI前线
开源动态8

智谱终于发布GLM-4.5技术报告,从预训练到后训练,细节大公开

上个月底智谱开源 GLM-4.5 及轻量版,成绩亮眼引热议。现其技术报告发布,详述预训练到后训练细节,还介绍了开源 RL 框架 slime,展示模型架构、训练阶段等,评估了在多任务上的表现。

机器之心
新闻资讯8

菲尔兹奖得主都栽了!Claude终结78年悬案,或成最重要AI数学成果

78年数学难题“六维球面上有无复结构”被哈佛数学家Levent Alpöge和Claude解决,他们绕开老路造出答案,还给出108页论证,数学家挑不出毛病。Alpöge在35天内三次用AI破难题,这次性质不同,是模型创造新对象。

新智元
推荐文章7

算力稀缺时代,如何把 GPU 用“满”

在 GPU 稀缺且利用率低的背景下,本文分析其‘用不好’的原因,探讨业界共享技术方案的局限。以腾讯云 TencentOS qGPU 为例,解析内核态虚拟及在离线混部技术,还介绍其在多行业降本增效的实践。

InfoQ
产品应用7

聊聊钉钉的悟空:给一个还没人走路的市场卖跑鞋?

钉钉发布悟空,与其他大厂先面向个人用户不同,它走企业级路线,有四层Skill体系等,虽初期被认为‘太重’,但钉钉全产品CLI等创新有潜力,且安全设计是企业刚需,适合特定人群关注。

刘言飞语
产品应用7

Nano banana手办玩法火爆出圈!无需抽卡,效果惊了(°o°)

小某书被AI手办图刷屏,原来是谷歌的nano - banana(Gemini 2.5 Flash Image)模型爆火。文章实测其手办玩法,还介绍多种玩法,团队透露以文本渲染评估、原生多模态等核心技术,谷歌未来想整合模态实现AGI,还将举办黑客松。

量子位