可脚本化」共找到 4642 篇相关文章

推荐文章7

万字长文!大模型LLM推理优技术总结

文章围绕大模型LLM推理优技术展开,先介绍LLM推理各阶段、批处理、KV缓存等概念及内存需求,再阐述模型并行、注意力机制优、模型优和模型服务等技术,如Pipeline并行、MQA、量、动态批处理等。

OpenMMLab
产品应用7

谷歌Gemini火力全开!实测:原生图像生成新升级确实强

谷歌Gemini原生图像生成功能升级,图像质量更好、文本渲染更准、生成速度更快。融合图片元素、实时编辑等,能免费试玩,开发者集成API。实测表现惊艳,也有翻车情况,还能搭配Gemini 2.5 Pro。

量子位
算法论文8

ECCV 2026 | 北大团队提出 Atomic Dance:基于原子动作的解释音乐舞蹈生成框架

北大团队提出 Atomic Dance 框架,以原子动作作为舞蹈基本单元,建立有明确语义和结构的舞蹈表示,设计“动作规划 — 舞蹈生成”两阶段框架,让生成的舞蹈更符合音乐节奏和编舞逻辑,具备解释性和编辑性。

机器之心
产品应用8

一款产品,同时为人类和 Agent 设计,LibTV 是怎么做的?

3月18日,LiblibAI旗下AI视频创作平台LibTV上线,它从设计之初就兼顾人类创作者和Agent。创作者端工作流画布控;Agent端通过Skill接口创作,交付编辑项目。该产品还针对两者差异做了设计,价格也便宜。

Founder Park
算法论文7

「Next-Token」范式改变!刚刚,强学习预训练来了

微软新研究提出「强预训练(RPT)」新范式,将下一个 token 预测任务重新定义为推理任务,利用海量文本数据进行通用强学习。该方法有扩展性、低风险等优点,实验显示其提升了语言建模能力。

机器之心
产品应用7

再见Bug!谷歌超级编码智能体Jules上线,免费使用直连GitHub

谷歌推出编程智能体Jules,进入全球测试阶段,有Google账户的开发者免费试用每日5次。它基于Gemini 2.5 Pro模型,能写代码、修Bug等,还连GitHub简流程,预计今年晚些时候推更多功能和企业版。

新智元
算法论文8

One RL to See Them All?一个强学习统一视觉-语言任务!

国内初创公司 MiniMax 提出 V-Triune 系统,让 VLM 单一训练流程学视觉推理和感知任务。它含三个组件与动态 IoU 奖励机制,基于此的 Orsta 模型在多项测试中性能提升显著,凸显统一 RL 方法有效性和扩展性。

机器之心
推荐文章8

构建分层的 Agentic RAG 系统:具备自主纠错的多模态推理

企业 AI 团队面临 RAG 系统在处理结构与非结构数据时的难题。本文探讨用分层多智能体编排解决“模态鸿沟”,介绍 Protocol - H 架构,阐述组件、机制、实现与集成,经基准测试验证其优势,还提及未来研究方向。

InfoQ
开源动态8

字节推出X-Streamer,实时口型同步与长程记忆数字人框架

字节推出端到端多模态人类世界建模框架X - Streamer,能从单张人像构建无限流式生成的数字人,实现音素级口型同步和长程记忆。其核心是“思考者–行动者”双Transformer架构,在两张A100 GPU上实时运行。

带你学AI
新闻资讯9

TR35亚太区入选者名单揭晓!他们是未来创新议程的制定者

本文是《麻省理工科技评论》正式发布2026年度“35岁以下科技创新35人”(TR35)亚太区入选名单,介绍了多位入选青年创新者在AI、生物医学、材料、能源等领域的突破性成果,展现亚太青年创新的交叉、落地趋势。

DeepTech深科技