「多角色架构」共找到 5551 篇相关文章
腾讯混元开源 4 个小尺寸模型,主打 Agent 和长文
8月4日腾讯混元开源四款小尺寸模型,参数为0.5B、1.8B、4B、7B,消费级显卡可运行。模型推理快、性价比高,在多领域表现出色,亮点是Agent和长文能力,已在腾讯多业务应用。
国产GPU赛道又跑出一个 2700 亿独角兽!“中国AMD”沐曦股份完成IPO,开盘大涨超 500%
继摩尔线程后,沐曦集成电路登陆科创板,截至发稿估值破 2700 亿。其核心团队多来自 AMD,产品覆盖多领域。虽三年累计净亏超 30 亿,但营收增长强劲。沐曦上市标志国产 GPU 进入“市场与资本检验期”。
无需准确传感信号!轻松搞定「多段软体机械臂」复杂位姿与形状控制
研究人员提出利用双向循环神经网络(biLSTM)的MSCA规划与控制策略,即便用不准确内部传感信号也能完成任务。实验显示该方法在多任务中表现优异,未来还将做进一步研究。
SGLang 贴近硬件:用编译产物(PTX/SASS)评审 PR #26588、DeepGEMM 与架构迁移
本文从「编译产物评审」视角,分析 SGLang 的 PR、FlashInfer DeepGEMM 及 Ampere→Hopper 架构迁移案例。指出算法面和编译产物面会有分歧,编译产物 diff 能提前揭示执行路径变化,对开源项目有增益。
刚刚,GPT-6代号再泄露!或将周四见
据传GPT - 6本周将发布,OpenAI「义父」爆料Codex接入最强Astra模型,其内部代号「mewfour」泄露。Astra内部版已解决多个数学难题,成本仅约2000美元,还或达网络安全最高能力阈值,可能开启多智能体原生时代。
突破传统检索瓶颈!阿里通义实验室发布 WebDancer,开启多步推理智能体新范式!
在信息爆炸时代,传统检索技术缺乏动态决策能力,难以满足多步推理需求。阿里通义实验室发布的 WebDancer 基于 ReAct 框架,通过四阶段构建,在测试中表现优异,未来规划拓展工具生态、突破任务边界等。
拒绝重复造轮子!抽象 80% 工作场景,打造可复用的"AI 助手工厂”
文章指出,为解决重复开发AI助手的效率问题,智空间团队将高频需求抽象为可复用技术方案,打造“AI助手生产线”。介绍四大高频场景本质、共性挑战及对应方案,还阐述分层架构、解决方案、prompt架构等,最终落地“助手工厂”产品。
Mamba 架构实现推理性能超 Gemma3-27B!推理模型开始迈入「无注意力」时代
PromptCoT - Mamba是首个具解码显存常量等特性且推理能力强的模型。当前推理大模型中注意力机制有局限,PromptCoT - Mamba实现无注意力推理,在多评测集超Transformer等模型,为无注意力推理生态奠基。
不造芯片的IBM把制程推到0.7nm!指甲盖大小芯片集成近1000亿晶体管,半导体底层物理有望突破
当地时间6月25日,IBM发布全球首个亚1纳米芯片技术0.7纳米节点,晶体管密度翻倍,性能和能效大幅提升。该技术源于纳米堆叠架构,若5年内量产有望革新AI芯片架构,但量产面临诸多挑战。
东南大学耿新团队:模型不是不会做,而是被「挤掉了能力」丨CVPR 2026
东南大学耿新团队针对模型多任务融合问题提出论文《Model Merging in the Essential Subspace》。指出多任务融合失败源于关键方向重叠冲突,提出 ESM 方法,能让不同任务在模型中稳定共存,实验显示其性能更优。