GPT 时刻」共找到 1140 篇相关文章

算法论文8

0%完成率!Claude、GPT、Gemini 全灭,SWE-Bench作者新作把AI圈干沉默了

SWE - Bench创建者推出新benchmark ProgramBench,测试AI从零构建软件系统能力。结果一线模型完成率0%,暴露AI擅长局部代码生成,缺全局系统规划能力,引发对其评估方式的讨论。

机器之心
7

星标超 29 万,OpenClaw 两天两次大更!适配GPT 5.4,告别“抽卡式 Prompt”

GitHub星标超28万的AI Agent开源项目OpenClaw,在周六与周日迎来两轮重量级更新,集中在模型能力、Agent架构、工程部署及安全机制四个方向。2026奇点智能技术大会将邀专家探讨其产业实践价值。

AI科技大本营
开源动态8

CVPR 2026 | AI寒武纪时刻?字节世界模型新作,仅靠视觉学习真实世界知识

豆包大模型团队与北京交通大学联合提出视觉世界模型 “VideoWorld 2”,无需依赖语言模型,仅靠视觉信息让机器掌握复杂能力。它能完成复杂手工任务,成功率远超主流模型,代码与模型已开源。

机器之心
开源动态7

走出 MMLU 的高分幻觉:AI Agent 的「斯坦利时刻」与职场生存法则

文章指出多模态大模型在基准测试分数高,在实际业务流程却像‘职场巨婴’。研究团队构建Trainee - Bench测试顶尖模型,结果显示模型离‘独立上岗’远,凸显提升Agent自主学习性的重要性。

AI科技评论
新闻资讯7

Data+AI 新年特辑:2025 的顿悟时刻与 2026 的关键十问 | Q推荐

过去一年,Data + AI 关注点从模型能力转向企业承载 AI 的系统能力。InfoQ 联合 Snowflake 发起直播活动,邀多行业人士复盘与前瞻,有认知回顾、十问环节,结尾嘉宾留 2026 预测。

InfoQ
开源动态8

单卡2秒生成一个视频!清华联手生数开源TurboDiffusion,视频DeepSeek时刻来了

清华大学TSAIL实验室和生数科技联合开源视频生成加速新框架TurboDiffusion,能让视频生成在保证质量下最高提速200多倍,单张显卡就能运行,还整合四项关键技术,有诸多应用意义。

开源星探
开源动态8

里程碑时刻!首个100B扩散语言模型来了,技术报告揭秘背后细节

蚂蚁集团与高校联合团队推出 LLaDA2.0 系列扩散语言模型,其中 LLaDA2.0 - flash 参数量达 100B。技术报告披露细节,其解决了 dLLM 做大做强难题,性能比肩 AR 模型,为扩散模型工业化带来转机。

机器之心
新闻资讯8

谷歌重回铁王座!Gemini 3吊打GPT-5,奥特曼发信承认技不如人

谷歌携Gemini 3和Nano Banana Pro强势回归AI王座,连奥特曼都承认谷歌「反超」。谷歌逆袭原因多样,创始人布林回归打破「大公司病」,CEO劈柴推动「AI优先」,还有自研TPU提供算力保障。

新智元
产品应用8

中国医生需要怎样的AI?GPT-5、OpenEvidence都输掉实战后,我们有了答案

国家卫健委定调医疗AI未来五年核心目标为「人工智能+基层应用」,但基层医疗AI应用现状不佳。临床专家认为能帮基层的AI要安全有效、人机协同,「未来医生AI工作室」符合这些要点,其基座MedGPT表现出色。

机器之心
开源动态8

具身智能迎来ImageNet时刻:RoboChallenge开放首个大规模真机基准测试集

近日,RoboChallenge推出全球首个大规模、多任务真机基准测试。它构建开放、公正、可复现的‘真实考场’,为视觉 - 语言 - 动作模型提供评估标准,推动具身智能发展,还提供远程测试服务等。

机器之心