文本输入」共找到 662 篇相关文章

算法论文8

EMNLP2025 | SFT与RL的结合,vivo AI Lab提出新的后训练方法

vivo AI Lab 算法团队提出新的大模型后训练框架 GTA,综合 SFT 和 RL 优点,解决文本分类场景中 RL 收敛慢问题。论文已被 EMNLP 2025 录用,介绍了 GTA 框架设计思路、实验结果等,未来还将探索更多场景和大模型。

机器之心
开源动态8

夯,开源 LiteParse,没有对手的 PDF 解析工具,知道的太晚了!

LlamaIndex团队开源独立工具LiteParse,用Rust打造,可本地运行、零成本、高精度解析PDF。它能提取文本及精确位置,有多种输出格式,支持多格式输入,还介绍了安装、使用、OCR配置等内容及应用场景。

小华同学ai
新闻资讯8

Gemini 3.5来了!今夜,谷歌亲手淘汰谷歌

谷歌I/O 2026大会火力全开,发布Gemini Omni、3.5 Flash、Spark等新品。Omni可接收任意输入生成视频,3.5 Flash性能强大,Spark是7×24h云端个人AI特工。谷歌多项能力同时到位,撕开了ASI入口。

新智元
产品应用8

Google Gemini Embedding2:一个模型处理所有媒体类型

Google发布Gemini Embedding 2,首个原生多模态嵌入模型。能处理文本、图像等多种媒体类型,支持交错输入,覆盖超100种语言。与多模型串联方案比,延迟降70%、召回率升20%。已可在Gemini API等使用。

AI工程化
产品应用7

新DeepSeek R1代码能力直逼Claude 4!附生成任何优质网站的通用提示词

作者体验DeepSeek R1超8小时,发现其文本写作问题大幅修复,思维链推理改进,代码能力提升,前端审美直逼Claude 4。文章展示其前端能力,给出写前端网页提示词及设计逻辑,还探讨了其在复杂任务中的表现。

花叔
开源动态7

AI办公斩杀线,一页文档多少钱

腾讯混元Hy4 preview正式发布并开源,参数770B,是开源阵营里参数最大的Apache 2.0模型。它能处理长文本,官方定位有软件工程、办公分析等四个方向。还分析了处理一页文档的成本,指出办公AI下半场重在‘读懂’。

CourseAI
算法论文8

李飞飞、Jim Fan和徐丹飞联合重磅论文:机器人灵巧手,可能走错了路

李飞飞等学者联合发表论文,分析当前触觉融合方案缺陷,提出 T - Rex 架构。它改变触觉输入方式,使用新编码方法和数据集,经三阶段训练,在 12 项任务评测中平均领先 30 个百分点,也指出了局限与未来方向。

DeepTech深科技
开源动态8

95%的人还在手动提取数据,用这个工具秒变结构化

文章介绍Google开源的LangExtract,它基于大语言模型,能将非结构化文本转为结构化数据。有精准溯源、少样本定义等6大优势,可3步完成安装配置,还介绍基础使用、长文档处理、多模型支持及实战案例等内容。

机器学习AI算法工程
推荐文章7

大模型最难的AI Infra,用Vibe Coding搞定

Andrej Karpathy 力荐的 Vibe Coding 在 AI Infra 开发中常「水土不服」,存在上下文丢失、决策偏离、质量不稳定等问题。文章提出文本驱动的 Vibe Coding 方法,并以 Agentic RL 中的资源调度系统为例验证其有效性,还介绍了相关团队和工具。

机器之心
推荐文章7

别再乱学AI了!我花7天实践了张Zara的方法,从此告别焦虑

作者实践张Zara的AI学习法后告别焦虑,分享学习-实践-链接-输出的心法。包括高质量输入,如看长视频、跟随创造者、深度用产品;内化输出,如公开学习、与创造者交流、实践;还提及启动和持续输出要点及优质信息源。

AI产品黄叔