AI模型测试」共找到 13715 篇相关文章

算法论文8

Meta打碎Transformer 8年铁律!改写AI最底层规则,模型首次冒出潜意识

Meta推出「自由Transformer」新模型,打破自2017年以来GPT模型核心规则,在解码器引入潜在随机变量Z,增加“潜意识”。仅增约3%计算开销,在多测试中超越大规模模型,或开启后自回归时代。

新智元
算法论文8

GAIR Paper 107|高校联合腾讯发布 GameCraft-Bench:AI已能端到端开发游戏,Claude Opus 四成达到可玩水平

香港中文大学(深圳)等高校联合腾讯发布 GameCraft-Bench,旨在构建基于真实游戏引擎、产物完整可运行且能验证的 AI 游戏生成评测基准,解决现有基准难衡量端到端可玩性的问题,测试显示前沿模型在游戏生成上仍薄弱。

AI科技评论
新闻资讯7

arXiv禁用AI,糊涂!18所高校联合发布首个AI科研评审平台

arXiv因AI生成论文泛滥,禁止接收未经同行评审的综述和立场论文。而18所高校联合发布的aiXiv平台,支持AI和人类共创科研成果,采用多阶段AI同行评审机制,引发对传统学术体系的反思。

新智元
新闻资讯8

从大模型到智能体:50+ 头部企业的 AI 进化实践

2025年AICon全球人工智能开发与应用大会6月27 - 28日在北京举办,50余家机构专家围绕AI Agent等前沿技术探讨落地实践与趋势。极客邦等企业代表分享应用布局,还有5大主题演讲、14个技术专场和50多个标杆案例。

InfoQ
算法论文7

模型刷数学题竟有害?CMU评估20+模型指出训练陷阱

CMU团队评估20多个大模型,发现只有强化学习(RL)训练的模型能将数学推理技能广泛迁移到其他任务,监督微调(SFT)训练的模型迁移有限甚至无迁移。研究还探索差异原因,表明RL微调更具优势。

量子位
新闻资讯7

用印度程序员冒充 AI 的“独角兽”彻底倒闭了!伪 AI 烧光 5 亿美元,连微软和亚马逊都被“坑”了

英国 AI 初创公司 Builder.ai 正式破产,欠下超 1 亿美元债务。它曾估值近 10 亿美元,宣称用 AI 构建应用,实际大量依赖人工。类似“伪 AI”公司不少,靠人力换融资,最终坑了投资人和用户。

AI前线
新闻资讯8

AI时代UI已死?Karpathy称产品要给AI开后门,还分享了自己的AI编程心法

Andrej Karpathy指出,只有复杂UI、无脚本支持、基于不透明二进制格式的软件产品,在AI时代会被淘汰。他给出风险评估清单,还分享AI编程心法,探讨编程中‘验证鸿沟’问题。

AGI Hunt
产品应用7

不是「电商 AI」,而是「AI 电商」

GenAI时代,AI与电商消费结合成趋势,“值得买科技”提出“全面AI战略”,发布火眼AIUC引擎等4个作品。其海纳MCP Server可输出消费服务能力,推动AI生态建设。还落地什么值得买Gen2和张大妈Agent等应用。

特工宇宙
新闻资讯8

哈佛《Science》研究:大模型已碾压人类医生!

哈佛医学院等团队让OpenAI o1系列大模型与数百位医生在多项测试中较量,大模型在各项诊断和管理推理任务上全面超越人类专家,不过当下模型处理非文本信号有局限。

AIGC开放社区
开源动态7

Rex-Omni:用 3B 模型颠覆目标检测

长期目标检测依赖传统坐标回归模型,MLLMs方法存在不足。IDEA研究院提出30亿参数的Rex - Omni多模态大模型,在零样本测试中表现超现有回归模型,还具备丰富语言理解能力,有独特设计和训练流程。

带你学AI