全模态生成式推荐」共找到 2639 篇相关文章

开源动态7

超强开源OCR,手写体识别能力超dots.ocr,封存多年的老文档数字化有救了。

文章推荐新开源的OCR系统Chandra,它对手写体识别做了优化,官方测评数据显示比dots.ocr强。介绍其适用于多场景及功能特点,还展示了不同场景的识别效果,建议有需求者多对比测试。

开源AI项目落地
开源动态8

利用大模型从开源情报中自动提取检测规则:LLMCloudHunter,有开源

随着网络攻击增加,威胁情报成主动安全关键。以色列本古里安大学发布LLMCloudHunter框架,用大模型从开源情报自动生成检测规则,评估显示其规则质量高,且大部分能编译成Splunk查询,软件已开源。

AI与安全
产品应用8

豆包输入法Mac版正式上线,所有人都该试试AI语音输入了。

豆包输入法Mac版正式上线,作者推荐大家用其语音输入与AI对话。如今语音输入法渐成熟,能提升输入速度与质量。豆包输入法免费,体验好,有流式输出、自动纠错、中英混说、轻声抗噪等功能。

数字生命卡兹克
新闻资讯7

反击AI论文!arXiv每年拒掉2%造假内容,自动化工具加入审核

AI生成论文泛滥,arXiv等预印本平台升级审核机制,用自动化工具检测。Nature发现每年约2%论文因AI使用被拒,如bioRxiv等平台每天拒绝不少AI手稿。平台既要防造假,又要避免误伤合理AI润色。

量子位
算法论文8

英伟达、港大等发布创新KV缓存,实现扩散模型无训练加速

多数开源扩散语言模型推理效率不如自回归模型,英伟达、港大、麻省理工研究人员联合提出Fast - dLLM。它用近似KV缓存机制减少冗余计算,还提出基于置信度的平行解码策略,测试显示能加速且保持生成质量。

AIGC开放社区
新闻资讯8

大模型全面爆发,所有榜一都是Gemini!谷歌一夜站到了台前

北京时间今日凌晨,Google I/O 2025 开发者大会开启。谷歌发布或升级系列 AI 工具与服务,如升级 Gemini 模型、推出编程智能体 Jules 等,还展示视频图像生成模型、搜索与购物模式升级,展现其在 AI 应用领域强势回归。

机器之心
新闻资讯8

Qwen3.8-Max 正式版终于发布了,能不能打过 GPT 看这里

Qwen 3.8 Max 正式发布,沿用 Qwen 3.5 架构,参数量扩展,重点提升 Coding、Work 和 Agent 能力。它将开放权重,价格有优势。在多项测试中表现出色,还新增多模态能力,已可使用并有优惠。

MacTalk
产品应用8

审美在线、随叫随到、月薪19刀——Lovart把AI设计师这件事做认真了

Lovart适合无设计预算的人,将专业设计师装进AI工具。其Brand Kit解决风格不稳定问题,Font Generator可生成专属字体,Create Skill能固化学习成本,还有Export PSD、Mock Up等实用功能,月费仅19美元。

AI寒武纪
新闻资讯7

AI 写代码太快,人类测试跟不上了,Meta 用新方法把 bug 检出率提升 4 倍

Meta 用即时(JiT)测试方法提升软件质量,该方法在代码评审期间动态生成测试,在 AI 辅助开发环境中将缺陷检测能力提升约 4 倍,源于代理式工作流兴起及传统测试套件的局限。

AI前线
产品应用7

MMX-CLI给AI Agent装上七种感官,内容创作更方便

MiniMax发布的MMX - CLI命令行工具,给AI Agent装上七种新感官,具备图像生成、视频创作等能力,可一站式解决内容创作问题。它安装使用简单,功能多,还能集成到现有工作流,不过采用按量付费。

AI工程化