评估制度」共找到 732 篇相关文章

新闻资讯7

突发!中国商务部已启动对Meta收购Manus的审查。

据英媒爆料,中国商务部启动对Meta约20亿美金收购AI初创公司Manus审查,重点评估其技术出口管制及地缘政治风险,审查处早期阶段,此事件给AI创业者释放监管信号。

开源AI项目落地
开源动态8

多人会话视频生成新突破:香港科技大学,浙江大学用单人数据实现多人交互视频生成

香港科技大学、浙江大学等开源 AnyTalker,提出音频驱动多人交互生成新范式。它用创新机制和两阶段训练策略,以少量数据实现多人视频生成,还构建评估指标,性能超现有方法。

AIGC开放社区
推荐文章7

强化学习 AI 系统的设计实现及未来发展

本文是阿里巴巴算法专家曹宇在 AICon 2025 北京站的分享,结合算法实践展示 RL 系统现状及发展脉络,探讨未来超大规模 RL 发展方向,涉及理论基础、业界实践、开源生态及社区共建。

AI前线
算法论文8

告别黑箱解释!首个潜变量自动解释框架 | CIKM'25

深度生成模型内部运作如「黑箱」,潜变量意义难捉摸。埃默里大学团队提出LatentExplainer框架,经数据扰动、智能提示、不确定性评估三步,为潜变量生成易懂解释,提升模型解释质量与可靠性。

新智元
推荐文章7

别再手动百度了!让 AI 帮你“开挂”搜全网,效率 x10

随着DeepSearch问世,搜索模式正从传统网络搜索向智能体搜索转变。文章拆解Search Agent核心模块,围绕制定任务、搜索、优化、应用和评估分析,介绍各模块特点、架构及优化方向等。

CourseAI
新闻资讯7

OpenAI IMO金牌团队爆料:AI拒绝作答第六题

OpenAI IMO团队接受采访,透露让模型获IMO金牌的项目仅用两三个月、核心开发者仅三人。还谈及模型证明风格、第六题失分原因、解决千禧年大奖难题距离等,强调通用技术及面临的新挑战。

机器之心
产品应用8

Nature报道:谷歌新模型1秒读懂DNA变异!首次统一基因组全任务,性能碾压现有模型

谷歌DeepMind团队推出生物模型AlphaGenome,能从1兆碱基DNA序列中预测数千种功能基因组特征,评估变异效应。它统一多任务,性能超现有模型,是生物领域里程碑,将助力理解疾病。

量子位
开源动态8

Agent全自动搭建代码运行环境,实时更新解决评测过拟合/数据污染问题|微软

长期以来主流代码修复评测基准SWE - bench问题多,制约AI模型能力展现。微软发布SWE - bench - Live,引入新Issue,实现环境自动化构建与更新,打破传统局限,还揭示传统基准过拟合问题。

量子位
开源动态8

能让DeepSeek自进化的Harness!LlamaFactory作者开源新工具:0.2元自动造Agent

LlamaFactory作者郑耀威团队开源的PenguinHarness,是全球首个支持多Agent自进化的Harness,能自动构建、评测和改进Agent。它成本低、速度快,适配众多模型,还有严格契约保障安全。已在生产场景应用,效果显著。

机器之心
推荐文章8

Anthropic揭秘Agent长线开发架构:引入GAN机制,Claude自主撸出全栈应用

Anthropic公开前端设计和自主软件工程最新突破,为让Claude构建完整应用,从GAN汲取灵感设计多智能体协同架构。介绍架构实践、解决的问题及应用效果,还探讨架构简化和设计规律。

AI寒武纪