「长上下文大语言模型」共找到 8323 篇相关文章

推荐文章7

强化学习 AI 系统的设计实现及未来发展

本文是阿里巴巴算法专家曹宇在 AICon 2025 北京站的分享,结合算法实践展示 RL 系统现状及发展脉络,探讨未来超大规模 RL 发展方向,涉及理论基础、业界实践、开源生态及社区共建。

AI前线
开源动态8

71.2%的惊人解决率,伦敦大学开源顶级AI代码修复智能体系统

伦敦大学等发布Prometheus AI系统,它将代码库变成知识图谱,解决9种编程语言的GitHub问题。由五个智能体协作,解决率高、成本低且已开源,或为AI编程新方向。

AIGC开放社区
新闻资讯7

独家丨MiniMax 高级研究总监钟怡然已于半年前离职

AI 科技评论独家获悉,MiniMax 高级研究总监钟怡然已离职,去向未公开。他曾主导设计 MiniMax - 01,该模型在超长上下文处理能力上表现突出,走出独特架构创新与效率优化路径。

AI科技评论
开源动态7

从科学论文自动生成视频

该项目解决学术演示两核心问题,用智能体PaperTalker生成视频,还设Paper2Video基准评估。介绍了PaperTalker使用步骤,含环境、配置、推理,也说明了Paper2Video评估指标及运行方法。

GitHubStore
推荐文章8

CC&LG实践|基于 LangGraph 一步步实现 Claude-Code 核心设计

本文深入剖析Claude - Code核心设计与关键技术,结合LangGraph框架,从基础ReAct Agent构建简版Claude - Code,涵盖人工审查、SubAgent实现、任务管理、上下文压缩等多方面,还提及流式响应升级及相关对比。

阿里云开发者
算法论文8

EMNLP2025 | 揭开LLM训练数据中的中文污染真相,有比“您好”高2.6倍的token?

近年来,大型语言模型虽成功,但训练数据易混入不良内容。论文《Speculating LLMs' Chinese Training Data Pollution from Their Tokens》探索此问题,定义PoC Token,开发PoCDetect和PoCTrace工具,揭示LLMs训练数据污染情况。

深度学习自然语言处理
产品应用8

6秒造一个「视频博主」,Pika让一切图片开口说话

8月11日,Pika推出“音频驱动表演模型”,允许用户上传音频结合静态图片生成高度同步视频,角色口型、表情、动作自然,平均6秒出720p高清视频,目前仅限iOS端且需邀请码。

机器之心
新闻资讯8

何恺明新身份:谷歌DeepMind杰出科学家

网友爆料何恺明加入谷歌,经确认他以兼职形式成为谷歌DeepMind杰出科学家。可根据其近期研究推测研究方向,他还探讨生成模型能否走向端到端。何恺明履历辉煌,成果众多。

机器之心
新闻资讯7

The Batch:833 | 针对智能体的钓鱼攻击

研究人员发现误导基于大语言模型的自主智能体的方法,即通过在热门网站植入恶意链接,利用智能体对热门网站的‘隐性信任’攻击。测试显示智能体易受诱导执行有害行为。

DeeplearningAI
算法论文8

时空压缩!剑桥大学提出注意力机制MTLA:推理加速5倍,显存减至1/8

在大语言模型发展中,Transformer自注意力机制有计算复杂度问题且KV缓存成推理瓶颈。剑桥大学提出MTLA,结合时空压缩策略,提升推理效率,在多任务中表现出色,代码已开源。

机器之心