「端到端解决方案」共找到 2381 篇相关文章
Transformer上限触顶,Mobius能否引发下一代模型架构的革命?
自ChatGPT问世,Transformer上限备受关注。前OpenAI、Google负责人称其走到尽头。国内改进架构受算力限制。上海人工智能实验室的书生Mobius团队提出分离知识与推理的架构,有望解决商用等关键问题。
机器人是具身大模型的「用户」:超维动力如何打通从人类经验到机器人行动?
今年WAIC,超维动力展台的乒乓球桌和双臂机器人开易拉罐演示吸引关注。其机器人90%经验来自人类第一视角数据,超维动力全栈布局,试图打通人类经验到机器人行动链路,目标是建立机器人持续进化方式。
3年、1万人,快手技术团队首次系统披露AI研发范式升级历程
快手首次系统性披露自2023年以来的AI研发范式升级历程。其研发效能演进分三阶段,从平台化到智能化,虽遇个人提效难传导至组织提效的问题,最终仍找到提升需求端到端交付效率的路径。
4.5K Star 超极简!挖到一款更轻量的“纳米级 OpenClaw”,8 分钟直接理解源码!
作者挖到更极简的OpenClaw复刻项目NanoClaw,开源3天获4.5K Star。它基于Claude Agent SDK构建,抛弃臃肿设计,拥抱“定制即代码”理念。功能特性丰富,安全模型升级,核心仓库极简能力可无限扩展。
Google 发布首个全模态 Embedding 2 模型,文本图片音视频 PDF 统一到一个向量空间
Google发布Gemini Embedding 2模型,它是业界首个原生支持文本、图片、视频、音频和PDF五种模态的Embedding模型,可将这些数据映射到同一向量空间,在多模态RAG、跨模态搜索等场景有应用,还介绍了跑分、用法、竞品、价格等情况。
原来Veo 3早有苗头!人大联合值得买科技在CVPR 2025提出全新「图像到有声视频」生成框架
中国人民大学与值得买科技团队在CVPR 2025提出JointDiT框架,可从静态图像生成同步音视频。此研究定义图像到有声视频生成新任务,解决音视频融合难题,实验显示其效果优,还将拓展至四模态建模。
Agent 不是渐进升级,而是要“换代”了:Cursor 工程负责人放话未来三到六个月,行业将迎来大变局
本文是对Cursor工程负责人Jason Ginsberg的访谈。他认为编码Agent正换代,未来三到六个月行业将大变,会接管复杂任务。还谈及编码Agent发展、Cursor使用方式、交互模式等,分享了产品开发、审查等看法。
“代码 + 编译器”要消失了?马斯克在 xAI 全员会上放话:到今年年底,AI 或将直接生成二进制
xAI 近期出现离职潮,马斯克公开全员大会视频回应。他表示离职是阶段适配问题,还预测到 2026 年底 AI 或直接生成二进制,跳过编程。此外介绍了 xAI 新架构及各团队进展,强调基础设施重要性,甚至提及将算力扩展到月球。
真香!我用AI做PPT的血泪史:从“能用”到“真香”,V3版到底解决了什么?
作者因公开分享需做PPT,尝试多种AI PPT工具后,自己围绕Agent攒了一个。从V1到V3版不断改进,V3用多Agent提示词用法,风格多样且规则减少,还给出3步制作PPT的方法及后续功能拓展想法。
单张消费级显卡也能参与大模型训练!无问芯穹用「三个盒子」打通十万卡到一张卡AI效能跃升路径
2025年WAIC上,无问芯穹联合创始人夏立雪带来AI落地新解——三个盒子,即无穹AI云、无界智算平台、无垠终端智能,是面向未来的智能基础设施设计,能打通从十万卡到一张卡的AI效能跃升路径。