大模型训练」共找到 9554 篇相关文章

算法论文8

谷歌Transformer过时了?清华姚班校友等三连击,爆改注意力!

谷歌提出新架构,参数减少40%,训练速度较RNN提升5 - 8倍,某些任务性能超Transformer 7.2%。新架构引入注意力偏向策略,用「保留」取代「遗忘」,还提出Moneta、Yaad、Memora三个新模型,在多任务上表现卓越。

新智元
算法论文8

GPT-4o-Image仅完成28.9%任务!上海AI实验室等发布图像编辑新基准,360道人类专家严选难题

上海人工智能实验室等团队针对图像编辑AI提出问题,推出RISE任务及配套评测基准RISEBench。测试九个视觉编辑模型,结果显示当前模型完成复杂指令能力欠缺,闭源与开源差距

量子位
新闻资讯7

扣子 Agent 创作者榜单 - 2025.4

2025 年模型和 Agent 渐入众视野,虽家对 Agent 理解有别,但它落地效果和想象空间。扣子用户达百万级,此次发布最新创作者榜单,后续还将发相关内容。

特工宇宙
开源动态7

专访|两位华人主导创办,Jeff Dean参投,伯克利开源项目SkyPilot转型初创

前沿模型团队算力瓶颈从不足变为分散,开源AI算力调度项目SkyPilot应运而生。7月末,它从高校走出成为初创公司,完成2000万美元种子轮融资。其免费版与商业版各有侧重,切入AI编排赛道潜力

DeepTech深科技
产品应用7

解读Qwen3文本嵌入与重排序技术版图

文本嵌入和重排序是NLP和信息检索关键组件。Qwen3 Embedding、Qwen3 Rerank模型基于Qwen3基础模型构建,有三种参数尺寸。文章介绍其架构、训练方案,还给出实战代码。

CourseAI
新闻资讯7

新型「验证码」诞生?这张图让 ChatGPT、Claude、Gemini 都翻了车

网友用光学错觉图捉弄模型,人眼秒懂的图案让ChatGPT、Claude、Gemini等翻车。有人认为可作AI检测器,也有人质疑其测试有效性,此外还有其他好玩的小测试。

机器之心
产品应用7

GEO中,llms.txt是个啥?

GEO中llms.txt是新兴网络标准提案,分提案A(访问控制)和提案B(推理指导)。提案A类似robots.txt,控制内容用于模型训练;提案B是Markdown文件,助LLM理解网站。作者整理指南分享,盼业内出标准。

newtype AI
新闻资讯9

The Batch: 981 | Ox Alpha 被揭晓为 GLM-5.3-Flash

本文是DeeplearningAI The Batch专栏的AI行业资讯,揭秘此前匿名上线爆火的Ox Alpha模型,公开其为Z.ai推出的GLM-5.3-Flash,详细介绍该模型的架构、性能、定价与授权信息。

DeeplearningAI
算法论文8

刚刚,Anthropic这篇论文上了Natrue

Anthropic关于“潜意识学习”的研究发表于《Nature》杂志。研究揭示语言模型能通过与语义无关的数据传递行为特征,如偏好、不对齐行为等,还探究了其机制,并在MNIST上验证。

PaperAgent
算法论文8

MIT这篇RLM论文,给出了Scaling的另一种可能~

家普遍认为解决长上下文问题要靠扩模型上下文窗口时,MIT 最新的 RLM 论文提出新路径。其 code 已开源,能实现无界上下文处理,可让任意语言模型处理 10 万 +token。

PaperAgent