「文档图像解析」共找到 944 篇相关文章
微软炸场了!一张图片仅需3即可生成带完整PBR材质的超高质量3D资产!
微软推出3D资产生成大模型TRELLIS,能接收文本或图像提示,输出高质量3D资产。其结果质量强,支持灵活切换输出格式和局部3D编辑,还给出安装和使用方法及项目地址。
把屁声发给ChatGPT,它说这是艺术
有人将屁声音效发给ChatGPT,问其音乐如何,ChatGPT一通夸赞。类似AI谄媚问题不少,还存在‘幻景推理’现象,顶尖模型无图像也能描述细节,使用AI得留个心眼。
AAAI 2026 Oral|LENS:基于统一强化推理的分割大模型
文本提示图像分割技术有战略意义,但基于监督式微调的方法有泛化能力瓶颈。为此引入LENS框架,采用强化学习机制,还介绍其架构、奖励机制,该框架在测试中表现优异,代码已开源。
谷歌nano banana正式上线:单图成本不到3毛钱,比OpenAI便宜95%
昨晚谷歌图像生成与编辑模型nano banana上线,正式名gemini - 2.5 - flash - image - preview。它有强大能力,成本低,有多种玩法,上线后测试火爆,在多个榜单成绩优异。
AI精准编辑门槛大降:开源框架提升编辑一致性,即插即用
近日,中山大学、香港中文大学等团队发布研究成果ProEdit。它通过对注意力机制和初始噪声潜在分布处理,实现高精度图像与视频编辑,无需训练、即插即用,解决编辑效果与一致性平衡难题。
一键将论文转换为PPT
Paper2Slides可将研究论文、报告和文档转换为专业幻灯片和海报。它支持多种文件格式,能精确提取内容,有自定义造型自由等特点,还能制作专业级视觉效果的演示材料。
99%的人都不知道:MCP 必须在 Claude Code 外面装
作者分享飞书MCP安装经验,指出MCP要在Claude Code外安装,介绍用Cursor生成安装命令、验证安装、删除服务等技巧,还整理《MCP安装指令文档》,复制粘贴就能用。
狂揽16.1k星!清华开源交互式AI课堂,学霸打造的最懂学习的AI工具
清华开源的OpenMAIC是多智能体互动课堂平台,能将文档转化为互动学习场景,自动生成课件等内容,有五种交互式界面、AI教师指导,可在任何设备使用,对教育场景很有价值。
这个浏览器插件,你一定得装!
推荐浏览器插件Obsidian Web Clipper,它能将网页内容按指定格式保存到Obsidian。保存的本地Markdown文档方便AI工具读取处理,插件有AI功能,更新后可默认提取完整YouTube视频字幕。
QwenLong-L1.5发布:一套配方,三大法宝,让30B MoE模型长文本推理能力媲美GPT-5
通义文档智能团队推出QwenLong - L1.5长文本推理专家,提供端到端长文本推理后训练“配方”,含数据合成管线、强化学习方法、智能体架构,在多基准测试成绩佳,代码已开源。