注意力残差」共找到 555 篇相关文章

新闻资讯7

突发:Claude引入强实名制验证!必须真人手持证件自拍,否则直接封号!

Anthropic宣布在Claude平台推出身份验证功能,部分用户访问特定功能或触发风控时需强制验证,要手持证件自拍。这一举措让中国用户账号风险大增,还可能冲击相关生态链,用户或转向ChatGPT。

新智元
新闻资讯7

AI看不懂的色盲测试背后,藏着一场像素与诗意的战争。

作者和同事测试AI色盲测试图,多模态模型Gemini 3 Pro、Claude Opus 4.5等纷纷答错,仅GPT 5.2 Thinking答对且靠代码作弊。研究发现,AI看图断章取义,缺乏人类的“格式塔”能力。

数字生命卡兹克
产品应用7

Deepseek是被降智了吗?

作者认为Deepseek被降智,存在诸多问题,如不懂用户意图、长文理解、措辞怪异、提示词调教难、无脑捧杀、幻觉率高、深度思考弱等,还对比了与GPT在人际交往话题回复上的异。

深度学习自然语言处理
8

Scaling时代终结了,Ilya Sutskever刚刚宣布

Ilya Sutskever 在访谈中称「Scaling 时代已终结」,指出当前模型存在能力参不齐、泛化不足的问题。他认为人类情绪类似价值函数,人类学习效率高。未来 AI 发展将进入研究时代,他还分享了 SSI 战略及对 AI 对齐等问题的看法。

机器之心
新闻资讯7

OpenAI:我们正朝着什么方向优化 ChatGPT?

OpenAI 官网文章称,ChatGPT 发展方向是成‘对你有用’的工具,不追逐 DAU 或让用户沉迷。它介绍了有用的使用场景,还提及健康使用方面的改进及与专家合作提升响应能力等内容。

特工宇宙
推荐文章8

AI智能体的上下文工程:Manus的构建心得

季逸超在文章中分享了 Manus 构建 AI 智能代理的心得,包括围绕 KV 缓存设计、使用掩码管理工具、将文件系统作上下文等内容,还指出要保留错误信息、避免小样本带偏等。

AI工程化
新闻资讯8

semianalysis 长文 | 关于Meta 砸钱、抢人、领导力、建帐篷、计算、数据和超级智能

Meta在基础模型性能落后,扎克伯格亲自挂帅开启AI军备竞赛。他砸钱收购、挖人、堆算力,建GPU集群,还面临Llama 4失败问题,试图通过一系列举措追赶超级智能。

AGI Hunt
算法论文8

AI"学霸"也解不出高中题?耶鲁、复旦发布MMSciBench,揭示AI理科推理能力短板

耶鲁、复旦等推出MMSciBench评测基准,揭示主流模型复杂科学推理短板。它有高质量数据、多模态多题型测试和精细知识分类体系。测试发现模型图文融合及推理能力弱,英文推理或效果更好。

深度学习自然语言处理
产品应用8

不是,高考刚结束,高考报志愿的Agent也来了?

夸克官宣夸克高考志愿大模型,虽未多提Agent,但作者认为其比Agent还Agent。该模型免费,以Qwen为基座,结合高考知识库,能生成详细志愿报告,考虑多方面需求,助力学子报志愿。

数字生命卡兹克
开源动态8

SOTA级视频编辑新方法:无需训练一句话编辑视频,背景保持100%

传统视频编辑工作流被AI重塑,但现有AI方法存在问题,多源于反演 - 编辑范式。西湖大学AGILab提出无需反演和训练的FlowDirector,开销低、支持广且能100%保持背景,还采用新策略优化。

量子位