文本规划」共找到 806 篇相关文章

产品应用7

实测惊艳全球的Veo3!音画同步无敌,贵是有原因的

谷歌开发者大会推出的Veo3模型,具备强大文本和图像转视频能力,首次实现视频与音频同步生成。实测中,它生成的视频音画效果惊艳,但也有翻车情况,谷歌还给出提示词编写指南。

机器之心
开源动态8

一个LoRA实现GPT-4o级图像编辑!浙大哈佛新模型冲上Hugging Face榜二

随着Gemini、GPT - 4o等把基于文本的图像编辑推向高峰,提高性能常需大量数据和大参数量模型。而浙大哈佛团队提出ICEdit,用少量数据和参数实现高质量图像编辑,媲美甚至超越商业大模型。

新智元
开源动态8

55.9K star!微软硬核开源文档转换神器,LLM最佳拍档!

介绍微软开源的轻量级Python文档转换工具MarkItDown,它支持20+格式智能转换为结构化Markdown,专为LLM文本分析场景优化,解决开发者处理多格式文档痛点,还阐述其功能、技术架构等内容。

小华同学ai
开源动态8

夯,开源 LiteParse,没有对手的 PDF 解析工具,知道的太晚了!

LlamaIndex团队开源独立工具LiteParse,用Rust打造,可本地运行、零成本、高精度解析PDF。它能提取文本及精确位置,有多种输出格式,支持多格式输入,还介绍了安装、使用、OCR配置等内容及应用场景。

小华同学ai
产品应用8

从Vibe Coding到Agentic Engineering:重构后台开发全流程

文章介绍从 Vibe Coding 到 Agentic Engineering 的转变,以真实需求为例,展示后台开发全流程,涵盖需求获取到合入发布各阶段,介绍各阶段工具及操作,凸显 Agentic Engineering 优势,强调人编排、AI 执行的核心理念。

腾讯技术工程
产品应用8

Google Gemini Embedding2:一个模型处理所有媒体类型

Google发布Gemini Embedding 2,首个原生多模态嵌入模型。能处理文本、图像等多种媒体类型,支持交错输入,覆盖超100种语言。与多模型串联方案比,延迟降70%、召回率升20%。已可在Gemini API等使用。

AI工程化
产品应用8

企业级AI Coding的落地方法,都在这本实战手册里了|甲子光年

春节后字节上线TRAE企业版SOLO模式,发布《2026企业级AI编程实践手册》。TRAE企业版SOLO模式有自主规划、工具集成、多任务并行等能力。手册沉淀字节经验,提供方法论和场景实践,助企业迈入AI原生软件工程时代。

甲子光年
推荐文章7

Skills 是短期红利还是长期壁垒?

网友提问,随着基础模型进化,Skills 是否会被自主规划取代,创业者布局 Skills 是短期红利还是长期壁垒。作者认为 Skills 既是短期红利,也是长期壁垒,并用 AI 发展三阶段解释,指出投资 Skills 应关注能力积累。

宝玉AI
开源动态8

蚂蚁C2LLM:基于注意力池化的代码检索新范式

在Code RAG场景中,传统文本Embedding模型处理代码表现欠佳。蚂蚁集团与上海交通大学联合发布C2LLM系列模型,引入注意池化模块,在MTEB - Code榜单表现出色,还得益于优质训练流程,成果已回馈社区。

PaperAgent
开源动态8

LTX-2开源:首个能同时生成视频和音频的模型

LTX-2开源,它是Lightricks团队开发的首个开源多模态基础模型,能联合生成音频和视频。采用非对称双流扩散变换器架构,用深度多语言文本编码器,速度比许多纯视频开源模型快,让模型理解声画关联。

AI工程化