「办公能力升级」共找到 3832 篇相关文章
视觉感知RAG × 多模态推理 × 强化学习 = VRAG-RL
数字化时代视觉信息愈发重要,传统RAG方法处理视觉信息面临挑战。阿里巴巴通义实验室的VRAG - RL将强化学习引入多模态智能体训练,革新检索生成范式,提升视觉语言模型多方面能力,代码已开源。
一份PPT 创 5000万美金ARR,挑战微软和Google,这家华人创业AI公司火了丨PMF 001
本文介绍华人团队创办的AI PPT企业Gamma,它获5000万用户,ARR破5000万美金且连续盈利15个月。其精准踩中AI节点,运用PLG模式打败Tome,从AI PPT升级为创意创作平台。
GLM-5.3你来定!智谱唐杰全球征集意见,评论区清一色:视觉
清华教授、智谱唐杰在𝕏征集GLM下个版本意见,浏览量达40w+。此前他有求必应,网友热情参与。这次评论区多要视觉能力,因GLM-5.2是纯文本模型,而对手多为多模态。
刷屏了!开源 2 天斩获 41K+ 标星!这个 OpenAI 赞助的 AI 终端 Warp 开源了!
Warp宣布开源,不到24小时GitHub Star数达3.5w+,现超41K。它从现代终端演变成Agent化开发环境,由OpenAI赞助。采用双轨制开源协议,推出“Agent优先”工作流,同步产品升级。
π0.7发布,VLA押出了机器人的GPT-3时刻
今天凌晨,Physical Intelligence发布VLA模型π0.7,首次在机器人领域证明组合泛化。它用多样化prompt处理多样数据,涌现多种能力,还证明数据过滤可能是伪问题,架构基于前作,推动VLA回归。
阿里 Qwen3-TTS 两大更新直接封神!支持跨物种音色克隆,3 秒复刻!
阿里通义上线 Qwen3-TTS 两大核心能力,VoiceDesign 支持全文本控制音色特征,VoiceClone 能 3 秒音频跨语言、跨物种克隆音色。更新指标亮眼,如 0.1 秒级生成速度等,还可上手体验。
SGLang|SGLang Diffusion
来自SGLang开源社区的Yichi介绍SGLang Diffusion,它是面向图像与视频生成的全开源扩散模型推理引擎。基于SGLang机制将能力迁移到扩散模型推理,能显著提速工作流,视频展示了多种功能。
GPT-5.2 上线!全面超越 Claude Opus4.5 及 Gemimi 3.0 Pro
OpenAI 正式宣布 GPT-5.2 全面上线,一口气推出三个版本。GPT-5.2 Thinking 在推理能力上拉开代差,是 OpenAI 首个达人类专家水平的模型。各版本定位清晰,不同用户使用时间有别。
字节跳动:Apache Doris + AI 一站式融合数据引擎的探索与实践
本文整理自字节跳动 DataMind 负责人演讲,介绍了基于 Apache Doris 打造的一站式引擎 DataMind。它集成 Hybrid Search、AI Function、GraphRAG 等能力,部分成果已贡献开源,还给出企业级 AI 问数落地方案。
Meta 发布 Docusaurus 3.9,新增 AI 搜索功能
近日 Meta 发布 Docusaurus 3.9,重点更新有现代化运行时环境、增强 AI 搜索能力、提升国际化灵活性。如支持 DocSearch v4 让用户对话查内容,提高 Node.js 最低要求,改进 i18n 配置等。