多任务架构」共找到 6440 篇相关文章

算法论文7

姚顺雨腾讯首篇论文:给AI下半场指路“上下文学习”

姚顺雨入职腾讯后首个成果CL - bench,用来测试大模型“从上下文中学习”能力。研究指出当下模型依赖“过去”知识,无法适应“当下”学习。评测中,十个前沿模型表现不佳,揭示其真实场景应用缺陷。

量子位
产品应用8

硬件成本直降60%!原生分布式VS传统分库分表数据库

服务器硬件价格上涨,传统分库分表架构资源利用效率低。OceanBase 作为原生分布式数据库,通过种技术优化资源,降低硬件依赖,个案例显示其能大幅降低成本、提升性能,获 Forrester 认证。

InfoQ
开源动态8

Lumina-DiMOO:模态扩散语言模型重塑图像生成与理解

上海人工智能实验室推出模态扩散语言模型 Lumina - DiMOO,它基于离散扩散建模,打破模态任务壁垒。相比传统自回归架构模型,它解决了生成慢、质量受限等问题,在项评测中夺魁。

机器之心
开源动态8

AAAI 2026 Oral|InfiGUI-G1模型来了,刷新GUI Grounding SOTA

模态大语言模型发展下,GUI Grounding任务是难题,现有RLVR方法有瓶颈。浙江大学等团队提出AEPO框架,推出InfiGUI - G1系列模型,小参数量刷新GUI基准测试SOTA,代码已开源。

机器之心
算法论文7

The Batch: 881 | 一千万 token 的输入上下文

Google的Ali Behrouz等人设计“记忆模块”集成到类transformer架构ATLAS,能处理一千万token输入。它替代注意力层,训练后在长上下文任务中表现佳,但小模型,大规模表现未知。

DeeplearningAI
开源动态8

YC掌门人60天写了60万行代码,一个人干20人的活,他把方法论全开源了

Y Combinator总裁Garry Tan 60天写超60万行代码,将方法论整合成开源工具gstack。它把Claude Code变成虚拟工程团队,含15个角色和6个增强工具,可并行运行个Sprint,还具备种实用能力。

AI寒武纪
开源动态8

智谱GLM-OCR,0.9B开源即巅峰,复杂文档精准解析

智谱发布并开源GLM - OCR,以0.9B轻量级参数在项基准取得SOTA。它解决视觉感知难题,具备视觉编码与语言解码协作架构,还可端侧与高并发部署,成本低,推动文档智能化处理升级。

AIGC开放社区
产品应用7

自主金融研究智能体

Dexter是自主金融研究智能体,会思考、计划和学习。它能将复杂金融问题转化为研究计划,利用实时数据执行任务、自我验证。介绍了其核心能力、安装使用方法、架构、项目结构、配置等。

GitHubStore
算法论文8

扩散语言模型九倍推理加速!上海交大:KV Cache并非自回归模型的专属技巧

上海交通大学EPIC Lab团队提出免训练推理缓存机制dLLM - Cache,复用特征降低计算量。它即插即用,通用于主流dLLM架构,在个基准测试中实现数倍推理加速,且不降低生成质量。

量子位
开源动态7

The Batch: 904 | 智能体全面释放

2025年11月开发者Peter Steinberger发布个人AI智能体OpenClaw,1月下旬在HackerNews提及后迅速走红。它可完成任务,有独特工作方式和架构,但也存在安全漏洞,引发AI社群讨论。

DeeplearningAI