「多阶段推理系统」共找到 4073 篇相关文章
Soul App 又又又开源了!这次是实时交互数字人,支持小时级长视频甚至无限时长!
Soul App 新开源实时数字人项目 SoulX-LiveAct,解决 AR 扩散模型流式生成稳定性问题。它实现 20 FPS 实时流式推理,延迟 0.94 秒,支持无限时长,有恒定显存等亮点,可用于多场景。
IEEE TVCG | 告别写代码!MoGraphGPT:基于模块化大模型与图形控制的2D交互场景创作
香港多所高校研究团队提出 MoGraphGPT 系统,结合上下文感知模块化大模型与图形化控制,能让用户零代码搭建 2D 交互场景。该成果被 IEEE TVCG 录用,还对比实验验证其优势。
AI时代已来,魔幻的大模型投毒事件,我们怎么应对?
央视315晚会曝光针对大模型的蓄意信息围猎,虚构手环经力擎系统包装成科技尖货。黑产靠此吸金,利用技术污染证据链。多方已行动,厂商需提升安全能力,消费者要保持警惕。
腾讯纯文本LLM训视觉encoder,拿捏图表长视频,达到开源小模型SOTA!
腾讯开源Penguin - VL,直接用纯文本LLM训视觉编码器,跳出传统多模态拼接套路。在2B/8B紧凑参数规模的复杂任务中竞争力强,训练分三阶段,相关代码、模型等已开放。
太巅了!MIT老哥在Transformer里造了台计算机,LLM从此不需要调用外部工具?
LLM在数学推理表现佳,但纯计算是短板。MIT的Christos Tzamos团队在Transformer内造计算机,实现WebAssembly解释器,解决数独难题,还突破注意力机制瓶颈,打开软件与神经网络新接口。
还需付费卸载龙虾?这只龙虾能直接「杀死」OpenClaw
OpenClaw曾引发安装热潮,如今因安全风险引发卸载潮。国家相关部门发布风险提示,网上出现卸载服务。而GenericAgent既能装也能卸OpenClaw,还能自我卸载,展现出硬核技术。
AI的七窍打通了!谷歌发布Gemini Embedding 2原生多模态嵌入模型
谷歌发布Gemini Embedding 2新型基础架构,将文字、图像等数据整合到统一维度,终结旧工作流。该系统赋予机器五维感知,建立跨媒介沟通语言,提升运行效率,在多场景有应用潜力。
定义RAG新基准?谷歌发布 Gemini Embedding 2:首个原生多模态嵌入模型,延迟骤降70%
谷歌昨夜推出首个基于 Gemini 架构的原生多模态嵌入模型 Gemini Embedding 2,通过 Gemini API 和 Vertex AI 向开发者公开预览。它可将多类型数据映射到统一嵌入空间,多项基测排名第一,还获早期合作伙伴高度评价。
19.2K Star!Linux上无缝运行Win应用,超酷~
在Linux系统下运行Windows应用一直是难题,开源项目WinBoat能让Linux用户无缝运行Windows应用,通过容器和远程桌面技术,将Windows应用变Linux原生窗口,还具备自动化部署等多样功能。
彻底告别VE与VAE!商汤硬核重构多模态:砍掉所有中间编码器
商汤科技联合南洋理工大学发布NEO - unify,这是“原生、统一、端到端”多模态模型架构,砍掉VE和VAE,用混合变换器架构打通视觉与语言能力,提升数据与算力利用效率,为跨模态智能系统奠基。