「AI自主优化」共找到 10624 篇相关文章

算法论文7

多模态模型挑战北京杭州地铁图!o3成绩显著,但跟人类有差距

近年来,多模态大模型在多种场景取得进展,但能否‘看懂图’存疑。西湖大学等团队提出评测基准ReasonMap,评估模型在地铁图理解中的能力,发现主流模型有瓶颈,闭源模型虽优但仍逊于人类。

量子位
新闻资讯7

Andrej Karpathy最新暴论:这类软件正走向绝境,PS首当其冲?

Andrej Karpathy认为,人机协作时代,复杂UI、缺脚本支持、基于自定义二进制格式的软件前景堪忧。他按风险等级列举不同软件,还强调不主动改造的产品处境艰难。

AI寒武纪
产品应用7

DeepSeek-R1 更新,思考更深,推理更强

DeepSeek R1 模型完成小版本升级至 DeepSeek - R1 - 0528,用户可在官网、APP 等体验,API 同步更新。该版本强化深度思考能力,在多基准测评表现优异,还改善幻觉、提升创意写作等能力。

AI工程化
新闻资讯8

豆包PC端前负责人,创业Agent操作系统

本文报道前豆包PC端负责人齐俊元离职字节后,正式推出主动式个人Agent操作系统Today,介绍了产品核心特性与齐俊元的创业历程,披露产品核心能力。

量子位
新闻资讯8

重磅!Anthropic内部神秘模型在黎曼猜想上取得突破:关键下界从41.6%推到67.2%

A厂宣布Claude在黎曼猜想相关问题取得进展,其内部研究版Claude将黎曼ζ函数零点满足猜想比例的已知下界从41.6%提升到67.2%,经数学家验证,结果意外且有新方法。

AI寒武纪
新闻资讯8

刚刚,OpenAI挖来黑客「祖师爷」!

OpenAI近期动作不断,菲尔兹奖得主、翁荔之后,黑客圈“祖师爷”Halvar Flake(真名Thomas Dullien)官宣入职。他是BinDiff之父,在谷歌有诸多成果,还参与开源项目用Claude修bug,此时加入或因GPT安全事件频发。

新智元
算法论文8

从答题到做实验:SciAgentGym让大模型进入科学工作流

复旦大学NLP实验室提出SciAgentGym,为科学智能体搭建工作流环境,还设计了评测集SciAgentBench。实验显示模型接入工具能提升成功率,但长流程任务性能下降。论文还提出SciForge构建训练数据,提升了模型表现。

机器之心
新闻资讯7

他给谷歌做出了最火CLI工具,结果被开了

谷歌老兵Poehnelt做的Google Workspace CLI工具获2.8万星,因仓库用谷歌Logo被开除,谷歌随后推出官方版。同时,谷歌人才出走严重,两天走两个诺奖级人物,Gemini核心开发者也跳槽,致股价大跌。

量子位
新闻资讯7

Anthropic CEO承认了!成立公司,因为看不惯奥特曼说谎

Anthropic CEO Dario Amodei在采访中自曝,成立公司不是为拯救人类,而是看不惯奥特曼说谎。这撕下了Anthropic恪守伦理的滤镜,揭示出其与OpenAI的纷争是团队内讧,如今已演变成万亿美元商战。

新智元
开源动态7

开源免费!一键给Agent接入A股28个「全场景数据端点」

想让Agent分析股票,却因数据来源难解决而无法使用。现推荐开源工具包a - stock - data,可一键给Agent接入A股28个数据端点,无需API等复杂操作,具有零依赖、全栈架构等特点。

开源AI项目落地