GPT Pro」共找到 1327 篇相关文章

算法论文8

北大发布学术搜索评测ScholarSearch:难倒一众DeepResearch的“开卷考试”

北京大学DS - Lab发布ScholarSearch,这是评估大语言模型学术检索能力的数据集,含223道高难度题目。评估显示现有模型表现欠佳,纯推理模型准确率低,有搜索功能的模型虽有提升但仍不足。

量子位
算法论文8

Google研究发现:Multi-Agent的核心竟然是Prompt设计!

Google和剑桥大学研究多智能体系统,发现提示设计影响大,有效拓扑结构占比小。提出Mass框架分三阶段优化,实验用Gemini 1.5 Pro和Flash模型,对比多种方法,在多任务上性能显著提升。

PaperAgent
新闻资讯7

谷歌Gemini-0605发布,全球大模型第一!

昨晚谷歌发布Gemini 0605版本,官方称其回归0325版本效果。该版本在多项基准测试中领先,Elo评分提升。谷歌针对反馈改进,使Gemini 2.5 Pro回答更优,还取消日期后缀,输入输出Token价格有优势。

探索AGI
算法论文7

间接提示词注入攻击(IPIA)原理、方法及案例

本文介绍间接提示词注入攻击(IPIA),它于2023年5月被认定,通过恶意三方数据攻击,适应性广。文中阐述攻击过程、方法,还以Mavy GPT日历泄露为例说明,指出虽有防护但攻击仍会持续。

AI与安全
开源动态8

大模型开网店,谁是经营高手?E-Commerce Bench开源揭秘

为评估模型长程经营能力,联合淘天集团发布E-Commerce Bench,以10万本金、365天经营网店来评测。从多维度评估18个模型,结果差异大,还发现单一指标会掩盖模型表现,评估基准潜力大。

千问大模型
开源动态7

大神周末开源省token野路子,claude fable5账单砍掉6成

外网大神周末开源插件,将模型上下文等渲染成图片,可让账单降低59% - 70%。原理是图片token只与像素尺寸有关。此前因模型识图能力差难落地,fable5证明其极限省钱且效果保留。

探索AGI
新闻资讯7

时隔9个月Meta全新模型Muse Spark发布:闭源,原生多模态,一发布就落后?

时隔9个月,Meta推出Muse家族首款大模型Muse Spark,原生多模态推理,但能力表现一般,编程领域落后于opus 4.6和GPT 5.4等。它有沉思模式,致力于成个人超级智能,技术亮点多,性能高效。

AI寒武纪
新闻资讯7

OpenClaw逼出Claude最强反击!GUI操控电脑和真人无差别,网友:这得花多少token?

Claude Code升级Computer Use能力精准反击OpenClaw,基于GUI操作,像真人操控电脑。升级后无需API或CLI改造,能操控传统软件,还上线远程控制、定时任务功能,有安全分层设计。已向Claude Pro和Max用户开放。

量子位
算法论文8

真·开外挂!MIT新研究:架构0改动,让大模型解锁千万级上下文

MIT CSAIL团队提出递归语言模型RLM,不改动模型架构,让GPT - 5、Qwen - 3等模型具备千万级token超长文本处理能力。它将上下文处理“外包”,实验显示其处理规模超前沿模型,复杂任务优势显著,多数场景性价比高。

量子位
新闻资讯8

华尔街彻夜难眠!Gemini 3屠榜金融「最难考试」,AI砸了「金饭碗」?

被誉为「黄金职业通行证」的CFA考试被AI攻陷,推理模型不仅全部通过三级考试,部分科目接近满分。如Gemini 3.0 Pro在一级考试创97.6%最高纪录。不过AI仍有局限,还不能完全替代分析师。

新智元