图灵-AGI测试」共找到 2168 篇相关文章

开源动态7

FACTS 基准测试套件问世,用于评估大型语言模型的事实准确性

FACTS 基准测试套件由 FACTS 团队与 Kaggle 联合开发,基于原 FACTS Grounding Benchmark 增加三个新基准,可从四个维度评估大模型事实性。初步结果显示进展与挑战并存,多模态成难题。

InfoQ
新闻资讯7

Genspark 将上线 AI 浏览器丨创始人最新分享:我看到了 AGI

Genspark 下周将上线 AI 浏览器。其创始人景鲲发文称,AI 将影响 99% 的人工作,白领工作或消失,应届毕业生可能毕业即失业。他基于使用近 1000 种 AI 产品的经验,认为 AGI 即将到来。

特工宇宙
新闻资讯7

1分钟烧掉165万元!马斯克死磕OpenAI,300亿新融资豪赌AGI

xAI每月烧钱10亿美元,正进行43亿美元股权融资,计划明年再筹64亿,还有50亿债务融资。马斯克有三张王牌,xAI预计2027年盈利,其目标是创造AGI,这场豪赌结果待时间揭晓。

新智元
新闻资讯8

刚刚,一口气连发3个王炸模型、亮出2026年AGI战略,昆仑万维夯爆了

27日下午,昆仑万维在2026中关村论坛发布全新AI游戏世界模型Matrix - Game 3.0、AI视频大模型SkyReels V4和AI音乐大模型Mureka V9,还公布2026 AGI战略,推动AI从全模态能力突破进入平台化构建阶段。

机器之心
新闻资讯7

独家丨盛大挖角代季峰,筹建新 AGI 公司对标 DeepSeek

AI 科技评论独家消息,盛大网络挖角清华副教授代季峰筹备新 AGI 公司,对标 DeepSeek,正招募核心团队。代季峰学术成果颇丰,项目或融合脑科学与 AI 架构,“旧互联网 + 学术”组合有挑战也值得期待。

AI科技评论
算法论文8

Anthropic、Thinking Machines Lab论文曝光:30万次压力测试揭示AI规范缺陷

Anthropic和Thinking Machines Lab等机构研究人员提出模型规范压力测试法,基于细粒度价值体系生成超30万个查询场景,分析12个前沿大模型回答,揭示模型规范存在原则冲突、解释歧义等缺陷。

机器之心
推荐文章8

刚刚,商汤内部两万字复盘曝光:多模态通往AGI核心路线首次公开

商汤科技联合创始人林达华撰写万字长文,剖析将「多模态通用智能」视为技术战略核心引擎的原因,探索组织及战略层面的思考。文章回顾商汤多模态之路,探讨多模态通向AGI的原因、构建路径等关键问题。

新智元
开源动态8

自回归科学基座模型 BigBang-Proton,提出实现 AGI 的新路线

超对称公司发布自回归科学基座模型 BigBang - Proton,挑战主流 AGI 技术路线。它实现多学科问题与 LLM 统一预训练和推理,有三项创新,在多专业任务表现出色,还提出宇宙尺度压缩构想。

AI科技大本营
新闻资讯7

狂奔AGI,Claude年终封王!自主编码近5小时震惊全网

METR报告称Claude Opus 4.5能持续自主编码5小时,超OpenAI最强编程模型。AI编码智能体任务时长指数级增长,不过迈向AGI仍面临长期记忆难题,未来一年该领域或有突破。

新智元
算法论文7

为什么AI总是"记错"你?我们造了一个"合成人生"来测试

现有AI记忆评测只记'事'不记'人',存在数据源窄、不重理解、注入成本高的问题。QuantaAlpha联合高校团队提出CloneMem基准测试,用'数字痕迹'评估AI Clone长期记忆能力,实验有反直觉结论并给出设计启示。

深度学习自然语言处理