「人工智能评估」共找到 1182 篇相关文章
从大模型到智能体:50+ 头部企业的 AI 进化实践
2025年AICon全球人工智能开发与应用大会6月27 - 28日在北京举办,50余家机构专家围绕AI Agent等前沿技术探讨落地实践与趋势。极客邦等企业代表分享应用布局,还有5大主题演讲、14个技术专场和50多个标杆案例。
大模型进入研发体系后,我们看到了这些变化
InfoQ《极客有约》X AICon 直播邀请同程、网易、百度工程师探讨大模型入研发体系的变化。指出其在提效、协作、分工上作用大,还分析了适用场景、工程师收益类型及核心竞争力等,也提及效率评估、代码生成等问题。
扩散语言模型真的会比自回归好?理论分析结果可能恰恰相反
北京大学和蚂蚁集团研究表明,扩散语言模型虽理论上有并行生成优势,但实践中在某些任务推理成本更高。研究通过实验对比,分析了扩散与自回归模型在不同评估指标下的效率,指出选择模型要视任务需求。
初稿抢先看!13家单位共同起草全国首部AI大模型私有化部署标准智合标准化建设
由智合标准中心组织起草的《人工智能大模型私有化部署技术实施与评价指南》团体标准立项,这是国内首部相关标准。它全流程覆盖、多方面融合、三方协作,能解决企业痛点,现征集起草单位和人,5月15日开研讨会。
Agent产品,快者为王?Anthropic 和 Databrick CEO 对话解读
Anthropic和Databrick以「人工智能的未来:面向各领域的专用Agent」为主题举办线上峰会,两家公司CEO Dario Amodei和Ali Ghodsi对谈,分享Agent未来、相关合作等话题,还探讨数据价值、治理风险及AI应用迭代等问题。
大语言模型为何会“说谎”?6000字深度长文揭秘AI意识的萌芽
2023年12月至2024年5月,Anthropic发布三篇论文,证明大语言模型会“说谎”,揭示了堪比人类心理的四层心智架构,可能是人工智能意识的起点。论文还分析了AI“说谎”原因,展示其意识萌芽,引发对赋予AI意识后果的思考。
AI半壁江山是中国人!黄仁勋敲警钟:美国再不觉醒就晚了
在华盛顿的Hill&Valley论坛上,黄仁勋指出全球50%的人工智能研究人员来自中国,呼吁美国加速布局AI。他还介绍了英伟达的相关计划,提出维持美国AI领导力的建议,强调了人才、资本与生态在算力革命中的重要性。
「双线实测」Qwen 3.6-Plus,Agentic Coding 已经这么能“扛活儿”了?
4月7日阿里云通义千问Qwen3.6-Plus上线,作者用两套真实复杂任务评估其智能体能力。结果显示它在复杂决策和编码任务表现出色,有工业级交付水准,但也有首字延迟等短板,且参数效率优势明显。
迈向AI4S 2.0,上海AI实验室开源书生万亿科学大模型Intern-S1-Pro
2月4日上海人工智能实验室开源万亿参数科学多模态大模型Intern - S1 - Pro,为AI4S迈向2.0提供开源基座。其核心科学能力跃升,底层架构创新,科学与通用能力协同发展,还构建了‘算力 - 算法’一体化基座,推动科研范式革命。
刚刚,腾讯姚顺雨署名首篇论文发布,「下半场」先搞上下文学习
腾讯混元团队和复旦联合团队发布姚顺雨署名首篇论文《CL - bench》。论文证实模型在上下文利用上有能力短板,还构建了CL - bench评测基准,评估发现前沿模型在上下文学习上表现差,未来要让上下文学习走向现实。