「评估体系」共找到 1237 篇相关文章
76%程序员依赖AI?代码安全挑战解析
GitHub报告显示76%程序员用AI编程,代码安全成挑战。腾讯等团队建A.S.E评测框架,有项目级代码生成等优势,能评估代码安全、质量与稳定性,未来将扩充功能,邀开发者参与。
研究表明:资深开发者在使用AI工具时,完成任务的时间比不使用时延长了19%。
研究通过随机对照试验,发现2025年初资深开源开发者使用AI工具完成任务时间比不使用时延长19%。当前衡量AI能力多依赖标准化评测,可能高估或低估其真实能力,研究旨在更准确评估。
人类创造力的核心机制,AI已经开始掌握了 | 北大CogSci 2025(Oral)
北大团队论文揭示AI开始掌握人类创造力核心机制,提出IEI框架量化评估AI组合创造力。研究发现GPT - 4等在创意理解超普通人,框架优化可提升AI创意输出质量,论文被CogSci 2025收录。
Google | 发布革命性编码智能体:AlphaEvolve,突破数学极限!
DeepMind 发布由 LLMs 驱动的进化编码智能体 AlphaEvolve,能演化代码库用于算法发现和优化。它结合 LLM 创造力与自动化评估,减少幻觉,在谷歌计算生态、数学算法等多领域有巨大应用潜力。
刚刚,马斯克Grok 4.1低调发布!通用能力碾压其他一切模型
xAI 低调发布 Grok 4.1 并向所有用户开放,可多平台使用。该模型在真实世界可用性上显著提升,尤其在创造力等方面出色。它在多项评估中表现优异,通用能力领先,情感智能、创意写作佳,还降低了事实幻觉。
多模态长文本理解测评首发:46款模型无一攻克128K难关
香港科大等研究者联合提出MMLongBench,用于评估多模态模型长文本理解能力。它覆盖5大类型任务的16个数据集,对46个模型测试显示,闭源和开源模型在长上下文任务均面临挑战,OCR和跨模态检索能力是瓶颈。
DeepSeek陈德里开发自动研究Skill,写一篇论文人类只动脑2小时
DeepSeek研究员陈德里用自己开发的技能DeliAutoResearch等完成研究综述论文。论文提出自动研究智能体L1–L5自主度分类体系,对比四大架构模式,分析17个主流系统,还提出六大开放问题。
告别“音画割裂”与“人物崩坏”!AutoMV:首个听懂歌词、卡准节拍的开源全曲级MV生成Agent
现有AI视频生成模型做全曲MV有时长限制、音画割裂和一致性差等问题。AutoMV作为开源多智能体系统,模拟人类影视制作流程,能生成长达数分钟、叙事连贯且音画同步的完整MV。
3 个 Multi-Agent 系统,把 GPTBots 的多智能体协作玩明白了!
文章介绍如何在GPTBots平台玩转多智能体系统,阐述多智能体协作优势、架构及三种协作模式,通过旅游规划、辩论对抗、商业决策三个案例展示协作模式应用,还给出总结与进阶建议。
一篇持续强化学习技术最新综述
文章对持续强化学习(CRL)进行全面考察,关注其核心概念、挑战和方法,提出新的分类体系,从知识存储和/或转移角度将CRL方法分为四类,并分别介绍各类方法特点。