大模型测试」共找到 9626 篇相关文章

推荐文章7

智能投顾的模型应用,为什么选择了“模型协同”?

模型时代,金融智能投顾落地是技术与业务安全的双重挑战。北银金科高级算法专家尹辰轩表示采用“模型协同”架构,能在性能、准确性与合规间找平衡,还阐述了架构亮点、问题解决办法等。

InfoQ
7

模型如何赋能 Web 渗透测试

文章指出传统Web安全检测有局限,而语言模型(LLM)可提升漏洞发现覆盖率与准确性。以mcp server为基础介绍自动化漏洞检测方案,还分享实践操作、遇到的问题及解决办法,分析其优缺点并给出拓展思路。

阿里云开发者
新闻资讯8

从 CIPS & CLM 迈进:中国模型的智能跃迁

中国中文信息学会2025学术年会暨第二届中国模型会(CIPS & CLM 2025)于10月28日在北京召开,众多专家学者参会。会聚焦模型多方面内容,发布“模型基金”,举办多场报告与论坛,展现中国AI领域进展。

AI科技评论
开源动态8

国产模型新SOTA:蚂蚁万亿级旗舰模型赶超GPT-5

蚂蚁集团开源万亿参数旗舰模型Ling-1T,属Ling 2.0家族。它激活比例低降低运算成本,训练有“Ling缩放定律”等方法,多项测试超主流模型,不过处理超长上下文成本较高。

AIGC开放社区
算法论文8

清华孙茂松团队 × 深言科技:以解释作为训练信号,让 8B 模型在幻觉检测上反超闭源模型

语言模型幻觉问题待解,成本与算力需求攀升。清华孙茂松团队联合深言科技提出FaithLens模型,把幻觉检测提升为整体评估,以解释作为训练信号,8B模型在多任务上超闭源模型

AI科技评论
算法论文8

伯克利联手“拷问”模型:最强Agent也才40分!新基准专治“不听话”的AI分析师

与伯克利团队推出IDA - Bench新基准,模拟真实数据分析场景,解决现有基准无法评估模型在动态交互中可靠性的问题。测试显示,顶尖模型成功率最高仅40%,不同模型还暴露多种问题。

量子位
算法论文7

模型的第一性原理:(三)信息论篇

本文从信息论角度解读模型第一性原理。介绍Shannon信息论,提出将其从以BIT为中心转换为以TOKEN为中心解释模型底层原理,还阐述模型各阶段信息论原理、定向信息计算方法,对比Granger与Pearl因果。

机器之心
新闻资讯7

全球开源模型,前十五名全是中国的

近日,随着新一代语言模型更新,开源模型成热门话题。Design Arena排行榜上,若设定为“开源”,前15名均为国产开源模型,排名第一的是DeepSeek - R1 - 0528 ,智谱、阿里等厂商多款模型上榜。

机器之心
推荐文章7

C端热战,B端暗涌:模型真正的战场才刚刚开始 | 《中国模型落地应用研究报告 2025》正式发布

InfoQ研究中心联合中欧AI与管理创新研究中心发布《中国模型落地应用研究报告2025》,从驱动因素、C端产品现状到B端落地现状,勾勒模型应用转折期的图景,分析应用难的原因及各端现状。

InfoQ
算法论文8

ICML 2026 | 模型内部也会长出「情绪树」,规模越越懂人心

ICML2026 论文指出,语言模型内部会自然形成类似人类心理学模型的「情绪树」,模型,情绪树越复杂,且在销售等任务上表现更好。同时,模型的情绪结构受身份设定影响,存在与人类相似的情绪识别偏见。

机器之心