「多模态输出」共找到 1196 篇相关文章
Claude Code没有“魔法”
资深工程师 Daisy Hollman 在演讲介绍了 Claude Code 插件设计与上下文工程原语,以及 Anthropic 内部多 Agent 工作流。指出定制模型可放大能力,上下文窗口是关键,还探讨多种插件抽象与工作流扩展方式。
谷歌放的这波免费AI额度,大到很多人以为是假的
谷歌在Google AI Studio上调整Gemini API免费层规则,额度达每分钟100万token,无额外申请门槛。覆盖Gemini 2.5全系列模型,支持多模态输入。开发者反应两极,有人看好,也有人质疑。
英伟达开源深度研究引擎:企业级数据不出门,研究自动做
NVIDIA推出AI-Q Blueprint,将深度研究流水线打包成Agent Skill,解决企业级数据处理难题。它能让企业数据不出门,代理框架可派任务并获报告,还支持多种认证模式,代码库可本地部署,专为深度研究打磨。
Codex+hyperframe做视频,让剪辑师们慌了?
开源项目Hyperframes刷屏,它是基于HTML的视频渲染框架,不用视频大模型,用普通语言模型就能生成可控视频。它与Remotion有区别,选了对AI友好的路,还介绍了安装、使用方法和适用场景。
Cloudflare 构建了面向 LLM 的高性能基础设施
Cloudflare发布全新基础设施,可在全球边缘网络运行大型AI大语言模型。它将模型输入处理与输出生成拆分,自研Infire推理引擎,还推出Unweight模型压缩系统,分享提示词缓存优化方案。
不改模型、不降质量,谷歌让Gemma 4快了3倍:本地跑大模型彻底变天
谷歌给Gemma 4家族更新Multi - Token Prediction推测解码架构,推理速度最高提升3倍且输出质量不变。介绍了LLM推理慢的原因、MTP解决办法、对开发者的利好、技术细节、使用方式等。
千问Qwen旗舰预览版Qwen3.6-Max-Preview发布
千问Qwen发布下一代旗舰模型早期预览版Qwen3.6 - Max - Preview,在权威评测中登顶最佳国产模型。此前开源的Qwen3.6 - 35B - A3B用30亿激活参数匹敌数百亿参数稠密模型,新模型在多方面给出技术演进方向。
Claude Opus 4.7连夜突袭:或将抢走全球7亿打工人饭碗!
Anthropic正式发布Claude Opus 4.7,定义为当前可广泛使用的最强Claude模型。其核心升级在复杂任务执行、高清视觉理解和长链路工作流,视觉能力大幅提升,在多方面超越对手,普通用户使用有三大变化。
在ICLR 2026主会之前,我们和30多位入选者聊了聊最前沿的AI细节
4月14日,智源社区、DeepTech联合举办ICLR 2026预讲会。会议聚焦顶会核心精华,三十余位论文作者分享AI Agent、大语言模型等热门领域成果,展示解决大模型痛点的研究。
智源:ArXiv CLI重磅开源!2亿+开放论文,即将化身科研智能体的技能包
智源研究院联合高校与社区开发者研发的 DeepXiv 开源并免费开放。它是面向智能体的科技文献综合性工具集,提供数据接入、一站式能力集成、丰富接入形式等核心能力,还通过实战演示展示其在科研任务中的价值。