「AI模型性能」共找到 14034 篇相关文章

产品应用8

新模型亦是新 Agent,Kimi-Researcher 超大量一手实测!

2025 年被称为“Agent 元年”,月之暗面发布了端到端强化学习训练的新一代 Agent 模型 Kimi - Researcher,其基座是自研新模型。文章对其进行大量实测,与 OpenAI 等对比,并探讨了 Deep Research 的重要性及 Kimi 的不足。

特工宇宙
新闻资讯8

Opus 5通关ARC-AGI-3!Harness正在变成捆住模型的绳子

ARC Prize官方给Opus 5的ARC - AGI - 3成绩为30.2%,但开发者Jeremy Berman让其借助电脑,正确率飙升至96.2%。还开源代码,换用Codex等测试效果差。表明模型强时,简单环境更佳。

新智元
算法论文8

AI越训练,越会「满嘴跑火车」!普林伯克利重磅揭秘,RLHF竟是罪魁祸首?

普林斯顿和伯克利研究《Machine Bullshit》,定义并量化LLM胡扯行为,总结四大套路,提出胡扯指数。实验发现强化学习人类反馈训练后,AI胡扯倾向加重,多思考也会让其更会忽悠。

新智元
产品应用7

剪映于近日上线两款 AI 产品 - 「小云雀」和「剪小映」

剪映近日上线两款 AI 产品「小云雀」和「剪小映」。小云雀是下一代创作 Agent,可零门槛创作视频、图片等,功能多样;剪小映则把「智能成片」细化,通过智能解析提升剪辑效率与创意。

特工宇宙
新闻资讯7

连Karpathy都怕了!9千万级AI包被投毒,竟靠黑客写出bug救命

3月24日,AI应用核心工具LiteLLM更新版本含恶意代码,可窃取开发者核心信息。因攻击者代码有bug致机器崩溃才暴露。这引发AI基础设施信任危机,Karpathy称要减少依赖。

新智元
产品应用8

扩散语言模型写代码!速度比自回归快10倍

Inception Labs推出基于扩散技术的大语言模型Mercury,它突破自回归模型限制,生成速度快,还解决了难以回头调整的问题。实测显示其代码生成速度比传统工具最多快10倍,且有强大纠错能力,但面临与当前CI能力不匹配问题。

量子位
算法论文8

邢波再出手:上次「骂」完世界模型,这次轮到智能体了

邢波教授新作《智能体模型批评》上线 arXiv,质疑当下被称为「智能体」的系统是否名副其实。论文将其分为两类,沿五维度拆解主流设计,提出 GIC 架构,还探讨了安全问题,指出要让能力内化进模型。

机器之心
推荐文章7

在全球 AI 的惊天变局中,为何越想独立,越要开放?

在科技巨头主导AI风向的当下,人们对数字命运的掌控感到焦虑,催生了主权人工智能概念。《主权人工智能现状》报告揭示,追求AI主权成全球共识,其核心驱动力有四,实现路径是开源,同时也面临挑战。

AI科技大本营
新闻资讯7

爆火的AI三宫格图片,比我们的生活更像电影。

最近三宫格AI图片爆火,起初是唯美电影感写真配文艺台词,后各地文旅、宠物赛道等画风渐趋抽象。其制作简单,用豆包的Seedream 4.0即可,文中还给出Prompt模板,该现象内核是将生活电影化。

数字生命卡兹克
新闻资讯7

AI生成内容新标准来了!现公开征集起草单位和专家!

随着AIGC转向产业落地,监管对生成内容管控成趋势。全国首个AI生成内容合规团体标准《人工智能生成内容合规管理指南》应运而生,还公开征集起草单位和专家,助力企业解决合规难题。

PaperAgent