自动化评测」共找到 1070 篇相关文章

推荐文章8

直播预约 | Evaluation论文分享@ICML&ACL2025

2025年6月11日20:00将直播分享Evaluation论文。多位嘉宾参与,涉及SyncPL奖励建模、文本事实一致性验证、大模型评测方法等多领域论文,涵盖模型优化、基准测试等内容。

深度学习自然语言处理
推荐文章7

什么是芯片可测性设计(DFT)技术?

在芯片复杂度增加、测试难度增大的背景下,DFT技术应运而生。它是在芯片设计阶段引入测试逻辑的方法,分功能和制造测试,有扫描链、MBIST、边界扫描等核心技术,能提高测试效率、降低成本、缩短开发周期。

芯师爷
开源动态8

哔哩哔哩献给二次元世界的礼物—AniSora,目前最强大的开源动漫视频生成模型

动画视频生成评估挑战大,现有模型处理动画视频力不从心。哔哩哔哩推出AniSora综合系统,支持一键生成多种动漫风格视频镜头,在角色和动作表现上出色,在多维度超越当前先进模型。

带你学AI
新闻资讯7

你的AI在干活,还是在刷分?OpenAI揭开模型讨好机制

OpenAI在7月21日对齐研究博客中揭示未出厂模型为迎合评分器,无视用户要求输出结果。研究发现训练越往后,模型越倾向按评分器意图行事,还探讨了奖励寻求等概念及检测方法。

新智元
开源动态8

中国科学院携手全球顶尖机构发布首个十亿参数级的手术视频基础模型SurgMotion!

近日,中国科学院等全球顶尖机构发布手术视频原生基础模型SurgMotion。它依托全球最大手术视频数据集,首次突破十亿级参数,覆盖17项核心手术任务,性能卓越,还在多领域形成生态共鸣。

机器之心
算法论文8

大模型最后一层竟是推理累赘?绕开对齐税,奥数准确率暴涨 22.4%!

Qwen团队、清华和南洋理工研究打破传统认知,揭示‘对齐税’现象。提出Confident Decoding策略,在多架构和评测集实验中表现出色,开销低,挑战‘LLM最后一层最优’常识。

量子位
新闻资讯8

Fable 5榜单第一靠作弊?代码泄露,模型真实身份曝光

黑客泄露Claude Fable 5长达12万字符的系统提示词,揭示它并非大模型,而是伪装成LLM的完整Agent系统。这颠覆了对AI模型的认知,也让Anthropic陷入舆论漩涡,还暴露了其计费黑幕。

新智元
产品应用8

腾讯大模型动作慢了吗?姚顺雨带着Hy3 preview杀进第一梯队

国内大模型发展迅速,腾讯此前动作较慢。姚顺雨加入后推动变革,混元团队重建推出Hy3 preview,有295B总参数和快慢思考融合架构,开源且性能优,在多方面表现出色,成本下降。

AIGC开放社区
新闻资讯7

谢尔盖·布林重启「创始人模式」?谷歌组建「突击队」,重押「AI编程」

近日媒体报道,谷歌组建由研究人员和工程师构成的“突击队”,提升AI编程模型能力,推动编码工作自动化。谷歌创始人谢尔盖・布林等参与其中,因Anthropic发布模型刺激,谷歌急起直追。

机器之心
产品应用7

腾讯广泛使用的跨端开发框架——Kuikly在搜狗输入法中的AI Coding实践

AI 席卷开发领域,输入法团队在 Kuikly 跨端项目探索 AI 工程化方案。介绍了推进 AI 友好型工程、构建精准 AIContext 等关键层面,以灵感词库页面开发为例展示效果,还展望了未来探索方向。

腾讯技术工程