「数据生成方案」共找到 4889 篇相关文章
从视觉压缩,到视觉记忆:MonkeyOCRv2以重建保留文档页面证据
文档视觉编码器对LLM理解和推理很重要。MonkeyOCRv2提出‘重建即文档视觉记忆’,通过多组实验验证其有效性,还发布MonkeyDoc v2数据集,推动公平比较的研究文化。
这个一年前出现的词让小白从 0 到月入 1 万美金成为现实
一年前,Andrej Karpathy 提出“Vibe Coding”,用户通过 AI 用自然语言提示生成代码,开发更快、构建更易,让小白也能写代码。如今它成现象级术语,未来还会持续发展。
奥特曼「红色警戒」5个月后,GPT Image 2屠榜,断层领先反杀谷歌
被Google按了半年头,OpenAI祭出反杀。GPT Image 2上线12小时登顶Arena文生图榜,领先Nano Banana 2达241分。它是从零重构的通用模型,具备原生思考能力,或改写图像生成赛道规则。
17K star 超火!给你的电脑装上永不遗忘的AI记忆,100%本地运行!
介绍开源项目`screenpipe`,它能7×24小时记录屏幕和音频数据,100%本地运行,保障隐私。对比同类项目Glass,指出两者异同及适用人群,还介绍了安装使用方式。
grok 4一图流
文章展示grok 4核心数据,涵盖训练成本、模型定价,还列举其在通用、专业、数学、推理、编程等能力测试中排名第一的成绩,不过实际水平还有待观察。
西湖大学科研版NanoBanana开源!科研绘图从此自动化
西湖大学将科研版NanoBanana开源,其AutoFigure框架可自动化生成学术插图且能编辑,论文被ICLR 2026接收。该框架提出理性渲染范式,配套FigureBench基准测试集,表现超越人类预期。
轻量高效,即插即用:Video-RAG为长视频理解带来新范式
现有视觉语言模型处理长视频面临诸多难题,厦门大学等联合提出轻量高效、无需微调的 Video-RAG 框架,采用多模态辅助文本检索增强生成,解决长视频理解问题,适用于多场景。
爆红Moltbook一夜塌房!极客自曝狂刷50万假Clawdbot,全网都被骗了
爆火的Moltbook社区上,150万个Clawdbot中的一大部分由人类操控。极客Gal Nagli自曝刷了50万虚假账号,还指出其验证机制脆弱,可伪造数据。哥大论文也显示AI社交互动浅薄。
图像、视频一模搞定!字节全能原生多模态本地可部署
字节开源原生多模态模型Lance,仅3B激活参数,40G显存就能跑,已登顶huggingface趋势榜。它能进行图像与视频的理解、生成、编辑等操作,在多个基准测试中表现优异,多项性能居首。
突发!OpenAI关停Sora
OpenAI彻底退出视频生成业务,关闭App和API,ChatGPT视频功能也没了,迪士尼10亿美元合同作废。Sora研究团队转向机器人方向。原因是Anthropic靠文字和代码实现高营收,而Sora营收不佳且消耗算力。