实时流式处理」共找到 1322 篇相关文章

开源动态8

腾讯重磅开源:端到端文档转换VLM,中英文错误率双料最佳!

腾讯开源端到端文档转换视觉模型POINTS - Reader,可将文档图片转结构化文本。它基于POINTS1.5架构,支持中英文。在OmniDocBench基准上,中英文错误率暂列最佳,具零后处理简单等亮点。

开源星探
开源动态7

全球首个多智能体Eigent开源!内置200+MCP,支持SSO企业级

OWL团队开源多智能体Manus类工具Eigent,能多智能体协作处理复杂任务。它可整合工具和数据,处理任务时清晰拆解执行。有多种预定义智能体,内置200+MCP工具,还支持人工干预。

CourseAI
产品应用8

把 MiniMax M2.7 扔进真实业务里:它替我省了 BI 和程序员的钱

作者测试 MiniMax M2.7,用含复杂数据的 Excel 测试其办公能力,让其开发管理系统验证工程能力,还测试 MaxClaw 多步骤 Agent。结果显示它表现出色,但处理复杂事件仍待优化。

InfoQ
产品应用8

NVIDIA 推出Rubin CPX,专为AI推理设计的GPU

NVIDIA发布专为大规模上下文AI推理设计的Rubin CPX GPU,性能提升显著,集成视频编解码器和长文本推理处理。新平台算力强,适用于代码生成与视频处理,多家公司将采用,2026年底上市。

AI工程化
产品应用8

阿里又放大招!一句话,造一个能走进去的世界

阿里上线HappyOyster 1.0世界模型,一句话生成可实时探索、交互的开放世界。它与文生视频不同,能让用户参与体验。该模型有世界探索和实时导演两大功能,技术优势显著,应用场景广泛。

新智元
开源动态7

离谱!我以为 OCR 还在一页页抠字,结果百度 1.2 万 Star Unlimited-OCR 直接把长文档一口气读完

百度开源的Unlimited - OCR项目目标是处理图片、长文档等资料,将其转化为Markdown等结构化结果。它提供多入口,解决传统OCR处理长文档的问题,有多种应用方向,但也有边界。

小华同学ai
算法论文8

性能提升11.74%!腾讯优图提出激励推理,专攻复杂指令

现有大语言模型处理复杂指令能力不足,腾讯优图研究团队提出激励推理方法。该方法能提升LLM处理复杂指令表现,在1.5B参数LLM上性能提升11.74%,媲美8B参数模型。

量子位
算法论文7

The Batch: 939 |在推理阶段学习长上下文

大型语言模型处理长上下文时通常准确性降低、速度变慢,研究人员提出TTT - E2E方法,通过推理时训练模型将上下文压缩到transformer权重中,还展示了其运作方式、测试结果等。

DeeplearningAI
产品应用8

马斯克AI女友直播「一秒变身」,Karpathy看完立刻投钱

世界首个支持直播推流的「实时」扩散AI视频模型MirageLSD诞生,大神Karpathy亲自站台。它能理解真实视频后同步生成AI视频,实现零延迟、无限时长、每秒24帧不卡顿,给视频娱乐和直播互动带来丰富想象。

新智元
产品应用8

DeepSeek-V3.2-Exp:用稀疏注意力打破长文本效率瓶颈

在NLP领域,处理长文本时传统注意力机制效率低。DeepSeek团队推出DeepSeek-V3.2-Exp模型,引入稀疏注意力机制,在保持性能同时提高长文本处理效率,降低计算复杂度,在多基准测试中表现良好。

CourseAI