「端到端文档转换」共找到 862 篇相关文章
我的空白页恐惧症,被AI治好了
作者分享摆脱空白文档恐惧的经验,认为可让AI先写初稿,人与AI协同创作。以百度文库Genflow 2.0为例,展示其在资料导入、任务执行等方面优势,鼓励大家尝试与AI协作。
Elad Gil:AI 应用进入收敛期,比模型跑得快才能抓住红利
硅谷AI投资人Elad Gil回顾AI领域投资,指出AI应用进入收敛期。基础模型头部梯队明显,格局难改;GPT-ladder带来新机会;应用端理解痛点、构建工作流的团队更有优势,AI Agent重塑商业模式。
太牛了~~复杂表格Cell合并、跨页拼接,中文领域96%,甩MonkeyOCR 20%
在PDF文档解析领域,复杂表格解析是难题。今天分享的OCRFlux是基于qwen2.5vl - 3B模型微调的解决方案,有单页解析和跨页段落/表格合并等创新点,测试得分超96%,远超MonkeyOCR等。
一晚上,用AI干了7个PPT(后续)v2 | PPT+AI 技巧分享
作者因网友提问,研究出用AI做PPT的办法,比写Python脚本简单。介绍了用cursor、claude code实现的具体流程,还提及套用公司模板的方法,认为Cursor正成AI操作系统,操作更简便。
大模型越反思越错,原来是长链推理通过自我说服加重幻觉 | 北邮
北邮研究团队通过思维链审计实验,揭示大模型长链推理‘越想越错’现象背后的元认知偏差。研究基于RFC协议文档构建受控知识域,分析推理过程,发现反思会加重幻觉,且现有检测方法难以应对。
哈工大发布动画多智能体,文本一键生成连贯动画
随着多模态模型兴起,AI生成叙事性视频成热点,但现有方法处理长视频有挑战。哈工大发布AniMaker框架,由多个智能体协作,实现文本到动画自动化转换,解决了视觉连贯和叙事一致等问题。
UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习
视觉 - 语言 - 动作模型(VLA)是机器人操作重要基础模型,但复杂任务成功率低,真机强化学习成本高。微软等机构研究者提出 UniSteer,将人类纠正转换成噪声监督,在多任务测试中提升了成功率。
AI生图免训练提速1000%,办法:最简洁的“三阶段流水线”
AI画图速度慢,过往主流加速方法有局限。MrFlow团队提出三阶段流水线,在Qwen - Image等模型上实现10倍以上端到端加速,生成效果好,优势显著,还能与时间步蒸馏叠加,且完整开源。
谷歌把电脑操作能力塞进Gemini 3.5 Flash!自己看屏幕狂点70轮
谷歌将电脑操作能力Computer Use内置进Gemini 3.5 Flash,该AI能通过看屏幕操作电脑,可执行点击、打字等动作。其覆盖网页、桌面软件和移动端,还加入安全约束机制,在基准测试中表现良好。
苹果画的饼谷歌率先搞定!Gemini全面进驻全家桶,连鼠标都AI上了
在Android Show独立发布会上,谷歌推出诸多新品,核心是将Gemini嵌入安卓底层,还带来AI鼠标光标、Googlebook等。Gemini能跨应用执行任务,Googlebook为其量身打造,谷歌这波操作像把苹果画的饼烙好端上桌。