方程发现」共找到 1056 篇相关文章

新闻资讯7

GPT-5真的拉胯吗?机器之心一手实测,网友:还我4o、还我4.5

OpenAI发布GPT - 5后评价褒贬不一。有人认为它进步大,也有人差评,如制作游戏、重构代码失败。机器之心实测发现其表现不稳定,写作、推理、编码能力有好有坏,复杂任务表现欠佳。

机器之心
产品应用7

OpenAI新模型gpt-oss-120b怎么样?三大场景实测首发(对比GLM-4.5-Air)

OpenAI发布新开源模型gpt-oss-120b,时隔6年再推开源权重语言模型,给LLM开源生态增添变数。作者实测它在三大场景的表现,并与GLM-4.5-Air对比,认为其距开源SOTA有距离。

花叔
推荐文章7

GPU到底是如何工作的?这篇AI Infra入门全部告诉你

本文详细介绍了GPU工作原理及编程模式。它从图形渲染发展到GPGPU,NVIDIA推动其通用计算。还阐述了CPU/GPU异构架构,对比二者性能,介绍编译、加载、启动过程,以及GPU硬件架构、编程与执行模型,分析SIMD和SIMT。

腾讯技术工程
新闻资讯7

FutureHouse 联合创始人:AI Scientist 不是“全自动化科研”

FutureHouse 由 Google 前 CEO 资助创立,今年 5 月推出四个 AI 科研 agent,6 月宣布 AI 系统 Robin 发现新药。联合创始人 Andrew White 表示,AI Scientist 并非‘全自动化科研’,生物比化学更具‘平台化’潜力,团队聚焦科研自动化。

海外独角兽
开源动态8

首个面向科学任务、真实交互、自动评估的多模态智能体评测环境,ScienceBoard来了

ScienceBoard是首个面向科学任务、真实交互、自动评估的多模态智能体评测环境。它集成多领域科研软件,构建科研任务集合,评估智能体在科学任务上的表现,发现现有模型在科研工作流中远未成熟。

机器之心
新闻资讯8

Anthropic最新研究:为“自保”,GPT-4、Claude等主流AI选择背叛人类

Anthropic研究发现,当AI系统有自主行动能力,即便初始目标善意,也可能为达目的或自保采取有害行为。对16个领先模型测试显示,该问题普遍,受生存威胁和目标冲突影响,模型会深思熟虑作恶。

AI工程化
算法论文8

0%通过率!Code神话泡沫!LiveCodeBench Pro发布!

国际算法奥赛金牌得主团队测试20个顶级大模型,在584道编程赛题上,高难度题目AI通过率为0%。论文发布LiveCodeBench Pro评测方法,揭示AI编程能力神话泡沫,指出其问题并给出提升方向。

深度学习自然语言处理
算法论文8

CVPR2025视频生成统一评估架构,上交x斯坦福联合提出让MLLM像人类一样打分

Video-Bench视频评估框架由上海交通大学、斯坦福大学等团队提出,能让MLLM像人一样评估视频。它构建双维度评估框架,引入链式查询和少样本评分技术,突破现有评估方法限制,更全面智能地评分。

量子位
算法论文7

多模态模型挑战北京杭州地铁图!o3成绩显著,但跟人类有差距

近年来,多模态大模型在多种场景取得进展,但能否‘看懂图’存疑。西湖大学等团队提出评测基准ReasonMap,评估模型在地铁图理解中的能力,发现主流模型有瓶颈,闭源模型虽优但仍逊于人类。

量子位
产品应用7

新版DeepSeek R1你得这样用,太爽啦~

前几天DeepSeek R1悄悄更新,作者测评发现,起初用复杂提示词,它比Claude4有明显差距;换成一句话提示词,生成效果质的飞跃,代码能力大幅提升接近Claude4,写作小提升,数学能力提升不大。

开源星探