「视觉内容创作」共找到 1716 篇相关文章
开源版AlphaXIV
开源版AlphaXIV可实现与arXiv论文智能对话,打破传统文献阅读壁垒。它利用微软Markitdown转换PDF,用MiniRAG索引内容,借助Google的Gemini API对话,还介绍了功能、问答流程、安装使用等。
一帮人All in AI,让搞体育的先赚到钱了
港股运动科技第一股Keep今年2月决定“All in AI”,近日发布财报宣布扭亏为盈,实现经调整净利润1035万元。这不仅是降本增效的结果,也意味着Keep在资本市场的身份发生了变化,成为全民AI应用的候选者。
Cursor要凉?我扒出33个隐藏技巧,把Claude Code调教成完全体!
作者分享Claude Code实用技巧,指出其默认状态有问题,如犯低级错误、无回滚功能。介绍基础设置、项目规则、用Hooks实现自动化等内容,能大幅提升其使用体验和生产力。
全球百万网友迷上赛博「养鱼」,我也被这群AI小丑鱼拿捏了
Draw A Fish是一款AI小游戏,让全球百万网友上头。玩法简单,在画布画鱼,达到一定相似度就能放虚拟鱼缸。它门槛低、有成就感和互动性,背后是基于PyTorch的卷积神经网络,用ResNet18架构和QuickDraw数据集训练。
ICCV 2025 | ECD:高质量合成图表数据集,提升开源MLLM图表理解能力
科研等领域图表是信息核心载体,先进开源MLLMs在高难度图表理解测试准确率低。本文提出ECD数据集,规模大、质量高、风格多样,还设计合成流水线与评测基准ECDBench,为开源MLLM提供支持。
X-SAM:从「分割一切」到「任意分割」:统一图像分割多模态大模型,在20+个图像分割数据集上均达SoTA
中山大学、鹏城实验室、美团联合提出X - SAM,统一图像分割多模态大模型。它将分割范式扩展,设计通用输入输出,采用端到端架构和三阶段训练策略,在超20个数据集达最优,为图像分割研究开辟新方向。
Omni-Effects:首个统一多特效生成框架
Omni-Effects是面向多样化定制视觉特效生成的统一框架,结合纯提示词驱动与空间感知提示,可精确控制特效位置。构建Omni - VFX数据集验证其有效性,在复杂场景有高鲁棒性。
LeCun出手,造出视频世界模型,挑战英伟达COSMOS
训练有效世界模型面临数据、任务难度、算力消耗和评估等难题。Meta研究者提出通用视频世界模型DINO - world,可预测未来帧,在多方面有优势,实验显示其性能显著,能降低对标注数据需求。
AI智能体的上下文工程:Manus的构建心得
季逸超在文章中分享了 Manus 构建 AI 智能代理的心得,包括围绕 KV 缓存设计、使用掩码管理工具、将文件系统作上下文等内容,还指出要保留错误信息、避免小样本带偏等。
ICLR 2025新成果:文档检索“降本增效”,从此“开挂”
传统文档检索系统处理视觉信息丰富的文档存在瓶颈,ColPali方法直接从文档页面图像生成多向量嵌入,简化流程、提高性能、降低延迟。ColQwen - Omni在其架构上扩展到图文+音频多模态匹配。