长文本建模」共找到 1205 篇相关文章

算法论文8

Communications Engineering | 西湖大学&女王大学:面向阵风气动建模的表面压力时空动力学关联研究

西湖大学联合女王大学团队提出 Graph Transformer 框架用于阵风气动建模,融合图神经网络与注意力机制,从表面压力信号学时空关联,实现气动力准确预测,为AI在复杂气动建模提供新思路。

力学与人工智能
开源动态8

上下文快2.9倍,解码快6倍:Kimi 用线性注意力实现性能与效率双突破

月之暗面团队的Kimi Linear模型,是混合线性注意力架构,核心是Kimi Delta Attention模块。它解决线性注意力的记忆及遗忘问题,在多任务测试表现出色,还开源相关资源,推动高效上下文模型研究。

AIGC开放社区
算法论文8

文生图Scaling新变量,被字节Seed团队发现了

ByteDance Seed团队研究发现,文生图模型中自然语言Caption变,不意味着模型获更多视觉监督,其信息量更能预测训练损失。团队提出Structured Prompt,从两侧提升文本条件,在多任务上取得显著提升。

机器之心
开源动态8

DeepSeek开源的不仅仅是个新OCR模型。。。

DeepSeek开源3B参数的新OCR模型,重新思考AI处理文本方式,用视觉token压缩文本信息。核心组件有DeepEncoder和DeepSeek3B - MoE解码器,实验效果好,成本降低,还解决了一些算法和工程问题。

AI工程化
新闻资讯7

Anthropic 技术栈里的「五宗罪」由何而来?

Anthropic的Claude模型升级后,用户却觉得不好用。X上帖子指出其存在文本和代码标记、模型能力、定价、上下文等问题,这些问题卡在生成、计算、上下文和Agent运行时的5个具体位置,导致各方面互相拖后腿。

AI科技评论
开源动态7

OpenClaw低调更新重磅版本,龙虾脚了

OpenClaw开发者Peter带来Computer Use工具Peekaboo v3版本,解决了Agent类产品无法直接操控桌面的问题。它能实现像素级截图、读取UI位置,还能完成各类操作,支持自然语言指令,有四种使用方式。

量子位
算法论文8

西湖大学张驰团队:不重训,也能让视频生成更更稳丨CVPR 2026

AI 视频生成目前存在视频稳定性问题,西湖大学张驰团队提出 《Free-Lunch Long Video Generation via Layer-Adaptive O.O.D Correction》。研究表明 FreeLOC 方法能提升视频生成质量,且具跨模型通用性,还揭示了问题机制,降低算力成本。

AI科技评论
推荐文章8

真正能用好AI的企业是怎么做的?(附企业级AI落地实战手册)

数字化深入,非结构化文档成企业难题。合合信息发布白皮书,提出复杂文本智能五大核心能力标准,用11个行业标杆案例展示多模态文本智能技术应用,提供可复制落地范本。

PaperAgent
新闻资讯7

Gemini 2.5 Pro 负责人:最强百万上下文,做好了能解锁很多应用场景

谷歌DeepMind上下文预训练联合负责人Nikolay Savinov在播客中分享Gemini 2.5上下文技术。他认为上下文能革新产品交互,与RAG协同,未来千万级token上下文将成标配,但当前百万级未达完美时扩规模意义不大。

Founder Park
产品应用7

GPT5.5 + Codex 如何跑一整夜,编程的下一步,不是辅助编程,是可托管执行单元

文章指出GPT - 5.5在Codex里展现出强大自主性,能处理时程任务。还介绍让其跑任务的方法及面临的问题,强调任务需状态机、证据链等,社区也在构建相关工作流层。

AI进修生