性能问题」共找到 4812 篇相关文章

算法论文7

从BERT到T5再到Qwen3:关于Embedding的八点总结

哈工大30+页综述聚焦通用文本嵌入(GPTE),系统介绍其架构、数据、模型,探讨预训练语言模型(PLM)给GPTE带来的基础能力与高级扩展,还涉及多模态、多语言、代码嵌入等应用。

PaperAgent
算法论文8

华人团队终结Token危机:扩散模型数据潜力超自回归三倍

最新研究发现,token数量受限下,扩散语言模型数据潜力超自回归模型三倍多。一个1B参数的扩散模型用1B tokens训练,在基准测试取得不错准确率,且未现性能饱和。

量子位
算法论文8

Make SFT Great Again!从SFT到DFT:一权重之差,泛化之跃

大型语言模型的监督微调(SFT)简单高效,但泛化能力弱于强化学习(RL)。本文直击 SFT 核心缺陷,揭示其泛化瓶颈源于隐含的“病态奖励结构”,并提出仅需单行代码修改的动态微调(DFT),实验表明其效果显著。

深度学习自然语言处理
新闻资讯7

因为GPT-5,这群人决定在Reddit上起义。

OpenAI上线GPT - 5时下架旧模型,引发用户不满。在Reddit等社区,用户掀起“还我GPT - 4o”运动,大媒体跟进。奥特曼改口,GPT - 4o回归部分付费用户,免费用户需充值。开发者与用户存在认知鸿沟。

数字生命卡兹克
算法论文7

智能体的致命三要素及六种安全设计模式

智能体发展带来诸多安全问题,仅靠外部防护不合理。Simon Willison总结其致命三要素,指出间接提示词注入攻击难防。Invariant Labs等提出六种安全设计模式,可综合使用,多LLM方法值得关注。

AI与安全
算法论文8

40年后,Dijkstra算法极限再被突破,清华段然团队更快最短路径算法摘STOC最佳论文

清华交叉信息研究院段然团队研究出全新算法,改进图灵奖得主等人1984年提出的算法,跳过不必要排序,专注重要点间最短距离,缩短计算时间。该研究在STOC 2025获最佳论文奖。

机器之心
产品应用8

单机狂飙4万亿参数,国产AI「四大天王」首次合体!这台超节点鲨疯了

国产「四大开源天王」可在单机运行,背后是「元脑SD200」超节点。它有超大显存、高速互联域和超强算力,支持64路本土GPU且可商用。浪潮信息以开源为战略加速大模型商业化落地。

新智元
算法论文7

无需外部数据!AI自问自答实现推理能力进化

卡内基梅隆大学团队提出SQLM框架,这是无需外部数据的自我提问模型,含提问者和解答者角色。通过强化学习最大化期望奖励,设计自监督奖励函数。实验显示其能提升Qwen2.5 - 3B - Instruct多任务准确率。

量子位
推荐文章7

硅基公司裁员二三事

作者回顾2017年入职硅基智能(当时叫南京必拓狮)的经历,讲述公司转型AI赛道的过程、产品开发情况,以及老板司马华鹏的想法和管理方式,还总结了创业应注意的教训。

Agent的潜意识
新闻资讯7

The Information:揭秘 OpenAI GPT-5 崎岖的研发之路

The Information揭秘OpenAI GPT - 5研发困境,今年OpenAI遇技术难题,o3等模型研发受阻,内部有分歧。不过GPT - 5在编程等方面有提升,虽难与早期飞跃相比,但改进仍有价值,公司还在开发‘通用验证器’。

宝玉AI