视觉功能」共找到 2160 篇相关文章

算法论文7

VQA高分是在看图,还是在记答案?ReKey只更新决定答案的那一小块

视觉问答模型准确率提升,但高分可能源于记忆。浙江大学等团队提出 ReKey,保留真实场景,只更新决定答案的视觉线索,使评测面向未见过内容,且多数环节可自动完成。

机器之心
产品应用8

CapCut Mate:开源剪映自动化神器,让AI替你剪视频!

CapCut Mate是开源免费的剪映草稿自动化助手,让开发者通过API控制剪映核心功能,效率提升超100倍。它功能丰富,覆盖剪辑全流程,适用于多场景,还提供三种使用方式。

小华同学ai
新闻资讯7

蚂蚁阿福对打ChatGPT Health,哪家强?

全球科技大厂在健康赛道竞争激烈,OpenAI推出ChatGPT Health,与蚂蚁阿福功能相似。对比发现,阿福在功能精细度、打通专业医疗服务上领先,二者都引入专家团提升专业性。

AI科技评论
开源动态7

Lovart的开源平替产品,完全本地免费的AI设计Agent。

Lovart是热门AI设计Agent但使用成本高,现找到开源平替项目Jaaz。它接OpenAI绘图API,支持Comfyui等本地工具,能免费本地使用,功能丰富,还将推视频生成功能

开源AI项目落地
新闻资讯7

ChatGPT开始预测用户年龄,NSFW内容要来了!

OpenAI于1月20日更新推出年龄预测功能,通过分析用户多方面信息判断是否为18岁以下。网友测试发现猜测较准,这或使NSFW内容限制放宽,不同模型版本情况有别,更新还改进语音和记忆功能

AI工程化
新闻资讯7

Meta出走华人创业团队,种子轮800万美元,要打造视觉AI记忆大脑

由前Meta顶尖科学家创立的Memories.ai获800万美元种子轮融资。其大视觉记忆模型LVMM解决AI‘记忆缺失’问题,在多领域刷新SOTA基准,应用潜力大,还开放API及网页应用。

机器之心
开源动态8

文本已死,视觉当立!Karpathy狂赞DeepSeek新模型,终结分词器时代

DeepSeek新成果DeepSeek - OCR以像素处理文本,压缩率小于1/10,基准测试领跑,开源一夜获4.4k星。Karpathy力挺,认为应赶走分词器,展望视觉成通用输入前景,马斯克有更科幻猜想。

新智元
开源动态7

11K+ Star!NotebookLM 最强开源平替来了,支持私有化部署!

NotebookLM好用但有数据隐私问题,GitHub上的SurfSense是其开源平替,支持私有化部署。它功能成熟,支持多种文件格式等,提供三种入门方式,虽缺PPT生成能力,但知识管理和问答功能够用。

开源星探
开源动态8

DeepSeek-OCR是「长文本理解」未来方向吗?中科院新基准给出答案

DeepSeek-OCR的视觉文本压缩技术降低长文本处理成本,中科院自动化所等团队推出VTCBench基准测试评估模型视觉认知,含三大任务及衍生版本,测试结果有‘U型曲线’,还评测多种尖端模型。

新智元
开源动态8

Hugging Face开源nanoVLM,750行代码可训练视觉语言模型,简单到令人发指!

Hugging Face开源全新视觉语言模型框架nanoVLM,仅750行代码就能从零训练高效能VLM模型。它在单张H100 GPU训练6小时后,在MMStar数据集准确率达35.3%,且能在免费Google Colab跑。

AGI Hunt