「AI处理长文本」共找到 10536 篇相关文章

开源动态8

王兴一鸣惊人!美团首个开源大模型追平DeepSeek-V3.1

美团首个开源大模型Longcat-Flash-Chat发布即引发热议。它在部分benchmark上超DeepSeek-V3.1等,编程能力也出色。技术报告透露美团对大模型的理解,还有新发现,且性能好、训练效率高。

量子位
新闻资讯8

马斯克狂烧14万亿,5000万H100算力五年上线!终极爆冲数十亿

马斯克宣布5年内实现5000万张H100的算力,成本超2万亿美元。他已有Colossus超算集群,Grok系列模型也展现强大实力。目前Colossus 2在分批落地,供电采取多元化措施。

新智元
算法论文8

天下武功,唯快不破:LLM高效架构最新最全面综述

大型语言模型虽成就辉煌,但训练成本高、推理延迟大,核心问题源于Transformer架构。这篇综述论文首次系统性梳理高效LLM架构创新方案,分类七大类方法,延伸至跨模态应用,为研究者提供‘效率蓝图’。

深度学习自然语言处理
新闻资讯8

身家25亿刀,是四家公司创始人,这位伯克利教授还在给本科生上课

加州大学伯克利分校教授 Ion Stoica 一边教书,一边多次创业成功。他是四家公司联合创始人,包括独角兽企业 Databricks 和 Anyscale。他带领实验室做研究,其创立的 LMArena 获 1 亿美元风投。

机器之心
开源动态8

科研写作神器,超越Mathpix的科学公式提取工具已开源

LaTeX公式OCR现有方法处理真实文献面临挑战,DocTron团队提出系统性方案。构建CSFormula数据集,提出DocTron - Formula模型,在评测和实际应用中表现出色,超越Mathpix等工具。

机器之心
算法论文8

SRO赋能Qwen-2.5-VL推理性能飙升16.8%

文本领域推理模型成就大,但多模态大型语言模型推理能力扩展遇阻,如冷启动初始化不足等。提出SRO三阶段训练框架,经测试,ReVisual - R1平均性能提升16.8%。

CourseAI
算法论文7

递归神经网络的复兴:Mixture-of-Recursions

Google DeepMind研究者设计的语言模型,能判断关键单词并进行深度递归计算,通过轻量级“路由器”节省计算资源,在同等训练成本下表现显著优于传统模型,文中还提及其他解决动态算力分配问题的思路。

PaperAgent
新闻资讯8

离职员工首次长文揭秘真实的OpenAI:一半是天才,一半是疯子,7天时间上线code x

OpenAI离职员工Calvin French - Owen分享在公司一年工作的回忆与反思。从企业文化、技术栈揭秘,到7天打造编程代理code x的故事,让我们首次得以窥见OpenAI内部。作者认为这里有独特文化和强大执行力。

AI寒武纪
新闻资讯7

突发!OpenAI收购失败,windsurf被谷歌一锅端

原定OpenAI收购AI编程初创公司Windsurf交易取消,其CEO等核心人员转投谷歌DeepMind,围绕Gemini研究“代理编码”。谷歌是“人才聘用”,获部分技术非排他许可,Windsurf继续运营。

AI寒武纪
开源动态8

微软开源新版Phi-4:推理效率暴涨10倍,笔记本可运行

今天凌晨微软官网开源Phi - 4家族最新版Phi - 4 - mini - flash - reasoning,它参数小性能强,适合边缘设备。采用自研SambaY架构,推理效率涨10倍,延迟降2 - 3倍,多场景测试表现优异。

AIGC开放社区