GPT-1」共找到 2555 篇相关文章

算法论文8

为防AI刷题,Nature等顶刊最新封面被做成数据集,考验模型科学推理能力|上海交通大学

上海交通大学王德泉教授课题组提出MAC基准,用顶级期刊最新封面构建测试集,评测多模态大模型能力。研究设计两种含“语义陷阱”的测试任务,发现顶尖模型有局限,还提出DAD方法提升表现,采用双重动态机制。

量子位
开源动态8

国产大模型持续开源的一周:DeepSeek、Qwen、字节、书生~

国产开源大模型持续发力,本周DeepSeek V3.1、字节Seed-OSS-36B等接连发布。此外,马斯克xAI正式开源Grok 2.5,英伟达也开源了Nemotron-Nano-9B-v2。PaperAgent专题进行了梳理盘点。

PaperAgent
新闻资讯7

OpenAI华人露头就被小扎挖!95后北大校友1个月前上直播,今天已是Meta人

OpenAI华人工程师露脸易被Meta挖角,此次主角是95后北大校友孙之清,他刚参与ChatGPT Agent发布直播就加盟Meta。此前Jason Wei等也被挖,网友调侃让奥特曼别让亚洲面孔上直播,OpenAI也在加强人才保护。

量子位
新闻资讯7

甲小姐对话黄伟:一边“找死”,一边活下去 | 甲子光年

云知声创始人黄伟创业13年、筹备上市5年,其经历反映中国AI企业生存真相。他分享云知声上市波折、战略选择、应对竞争策略等,如在‘等死’与‘找死’间抉择,认为市场分散利于创业公司,AI 2.0竞争更激烈。

甲子光年
算法论文8

密室逃脱成AI新考场,通关率不足50%,暴露空间推理短板丨清华ICCV25

清华大学团队受密室逃脱游戏启发,提出EscapeCraft:一个3D密室逃脱环境,用于评估多模态大模型在视觉环境中完成复杂任务推理的能力。该论文已入选ICCV 2025。研究评测了多个热门模型,发现它们在推理和探索行为方面存在诸多问题。

量子位
产品应用8

微软上线Deep Research:OpenAI同款智能体,o3+必应双王炸

今天凌晨微软在官网宣布,Azure AI Foundry中上线Deep Research公开预览版,这是支持API和SDK的OpenAI高级智能体研究能力产品。它通过必应搜索与GPT系列模型深度协同,将研究流程全面自动化。

AIGC开放社区
推荐文章8

极致优化Android平台APK的大小

文章以Android为例,介绍UE包可裁剪部分的优化思路与实践,优化APK大小和Native库运行时内存占用。从压缩NativeLibs、代码体积优化、资源裁剪等方面着手,还给出优化效果和额外资料。

腾讯技术工程
算法论文8

北大发布学术搜索评测ScholarSearch:难倒一众DeepResearch的“开卷考试”

北京大学DS - Lab发布ScholarSearch,这是评估大语言模型学术检索能力的数据集,含223道高难度题目。评估显示现有模型表现欠佳,纯推理模型准确率低,有搜索功能的模型虽有提升但仍不足。

量子位
算法论文8

Google研究发现:Multi-Agent的核心竟然是Prompt设计!

Google和剑桥大学研究多智能体系统,发现提示设计影响大,有效拓扑结构占比小。提出Mass框架分三阶段优化,实验用Gemini 1.5 Pro和Flash模型,对比多种方法,在多任务上性能显著提升。

PaperAgent
算法论文7

Reasoning模型在RL下的探索欲望急速下降问题:探索熵机制

论文研究发现大模型经强化学习训练解题时,会出现模型探索欲望急速下降的熵崩溃现象,如训练初期策略熵断崖式下跌。对此进行规律分析、追根溯源,提出破解方法,研究对AI训练范式变革有重要意义。

深度学习自然语言处理