文档级」共找到 1223 篇相关文章

开源动态8

MinerU又开源了!这次专治OCR跨页失忆症

文档解析领域,MinerU团队开源了专门给OCR结果做“后处理”的4B小模型MinerU - Popo。它能把碎成一页一页的OCR结果重新拼成文档级结构,解决了当前OCR跨页逻辑断裂问题,且效果和成本优势突出。

CourseAI
开源动态8

沉浸式翻译杀疯了!双重开源:左手像素还原PDF排版,右手本地AI隐私保护!

沉浸式翻译是跨平台在线翻译工具,有网页、文档等翻译功能,获千万用户与Chrome年度殊荣。近期开源BabelDoc和OneAIFW,前者还原PDF排版,后者保护本地隐私,解决阅读和安全问题。

开源星探
开源动态8

GitHub热搜,腾讯黑科技炸场!PhotoMaker:10秒定制真人头像,百万开发者已疯狂

PhotoMaker是腾讯ARC实验室联合南开大学发布的人像图像生成项目,荣膺CVPR 2024。它能秒生成高质量人像,有高保真ID嵌入等机制,V2版升显著,适用多场景,比同类项目优势明显。

小华同学ai
开源动态8

混元3D世界模型1.0 lite版本发布,消费显卡就能跑

腾讯混元3D世界生成模型HunyuanWorld 1.0发布即开源,可在消费显卡运行,还能兼容传统CG管线。它分层实现3D生成,通过量化等技术降低显存开销,与同类模型相比优势明显。

量子位
开源动态8

腾讯混元世界模型1.1开源:单卡秒重建3D世界成为现实

腾讯混元团队开源混元世界模型1.1,它是混元3D世界模型1.0升版。新增多视图及视频输入,单卡可部署,秒创造3D世界。有核心突破,能处理多任务,经训练策略优化,多测试表现佳。

AIGC开放社区
产品应用7

我如何用低代码平台复刻NotebookLM体验:从文档到可控PPT生成,全流程实战。

本文作者用低代码平台BISHENG复刻NotebookLM的PPT生成功能。介绍了技术栈,详述工作流搭建,包括文档上传、问答、PPT生成等,还提及HITL机制提升成功率,最后总结了低代码平台的优势与不足。

AI大模型应用实践
新闻资讯7

奥特曼刚刚发文,10GW核爆算力!每周一座核电站,五座新城官宣

继英伟达千亿投资OpenAI后,「星际之门」官宣新增五个站点,预计年底前达成10GW目标。奥特曼发文称要打造每周GW「AI工厂」,认为AI无限算力或可治愈癌症。

新智元
开源动态8

1.5B参数撬动“吉卜力”全能体验,国产开源之光多模态统一模型,来了

GPT-4o引发“吉卜力”风暴,改变AIGC范式。昆仑万维开源多模态统一模型Skywork UniPic,1.5B参数就能接近甚至超越十几亿参数专用模型,可在消费显卡运行,还公开全套资源。

量子位
开源动态8

腾讯混元图像3.0开源榜一,工业800亿参数可商用,附提示技巧

28日,腾讯开源800亿参数的工业原生多模态生图模型HunyuanImage 3.0,个人和月活≤1亿公司可免费用。它是全球参数量最大、性能最好的开源图像生成模型,技术强、评估表现优,官方还整理了提示词手册。

AIGC开放社区
算法论文8

亿短视频数据突破具身智能Scaling Law!Being-H0提出VLA训练新范式

真机数据匮乏使具身智能VLA模型发展受限,现有真机数据与所需上亿训练样本相差甚远。BeingBeyond团队提出创新性方案,利用人类视频手部数据构建数据集,训练出VLA模型Being - H0,经实验验证效果良好。

量子位