「质量 - 延迟权衡」共找到 878 篇相关文章
这张信息图,居然是8B开源模型做的??
商汤新开源的 8B 多模态模型 SenseNova U1,架构独特,图像评测表现好,信息图生成能力强、延迟低。它具备图文交错能力,适合自媒体、敏感行业等,有在线体验和开源代码入口。
Depth Anything再出新作!浙大&港大出品:零样本,优化任意深度图
浙江大学与港大团队推出「Prior Depth Anything」,融合深度传感器数据与AI深度图,一键补洞、降噪、提分辨率。无需额外训练,可提升3D模型深度质量,零样本刷新多项深度处理纪录。
每秒生成超30帧视频,支持实时交互!自回归视频生成新框架刷新生成效率
微软研究院与北大联合发布Next - Frame Diffusion (NFD)新框架,通过帧内并行采样、帧间自回归等方式,让视频生成在保持高质量的同时,效率大幅提升,还采用多项技术进一步优化。
豆包输入法Mac版正式上线,所有人都该试试AI语音输入了。
豆包输入法Mac版正式上线,作者推荐大家用其语音输入与AI对话。如今语音输入法渐成熟,能提升输入速度与质量。豆包输入法免费,体验好,有流式输出、自动纠错、中英混说、轻声抗噪等功能。
谷歌推出 Jules:一款基于 Gemini 2.5 的异步编程智能体
谷歌将异步智能编程助手 Jules 正式发布,它基于 Gemini 2.5 Pro 模型,可执行多种编程活动。采用异步模式,直接接入代码库。测试阶段开发者反馈多,正式版有三种访问层级,但部分用户对其界面和输出质量不满。
英伟达、港大等发布创新KV缓存,实现扩散模型无训练加速
多数开源扩散语言模型推理效率不如自回归模型,英伟达、港大、麻省理工研究人员联合提出Fast - dLLM。它用近似KV缓存机制减少冗余计算,还提出基于置信度的平行解码策略,测试显示能加速且保持生成质量。
一文读懂DeepSeek-V3.2核心技术DSA:API疯狂降价性能不减的背后
DeepSeek发布实验模型DeepSeek V3.2,引入自研稀疏注意力机制DSA,API价格最高降75%。DSA先筛选后计算,含闪电索引器和稀疏多潜在注意力两组件,分四步工作,权衡了精确性与速度。
The Batch: 938 | Gemini 的音乐生成器
Google将音乐生成器Lyria 3加入Gemini和YouTube,它接收文本或图像生成30秒音频,支持多语言歌词。在质量和遵循提示上优于前身,采取版权保护措施,对特定用户免费或提供高额度使用。
大模型Agent的核心还是prompt? 目前有什么挑战?
文章指出大模型Agent核心并非Prompt,而是工程化架构设计、工作流编排与数据闭环。介绍Flow Engineering等概念及工具,分析规划、记忆、工具使用要点,还谈及开发面临的延迟、稳定等挑战,并给出应对建议。
95 后团队做 3D 大模型,拿下头部游戏重磅合作,正在定义 3D 生成的新规则
影眸科技年轻团队携 3D 生成模型 Rodin 获头部游戏合作。其研究入选 SIGGRAPH 最佳论文提名,还完成融资。新模型 Rodin Gen - 2 提升生成质量与可控性,在多领域应用,定义 3D 生成新规则。