「图中文字」共找到 2924 篇相关文章
Hermes Agent 终于有入门指南了
Hermes Agent 是 Nous Research 推出的开源 Agent 框架,功能强大但开发者不知如何使用。4 月 8 号,Kevin Simback 整理出 Hermes 生态全景图,另一人推出《Hermes Agent: The Complete Guide》,48 小时获 568 星。
「算网杯」2025 AIGC 开发者大赛决赛入围名单公布
「算网杯」2025 AIGC 开发者大赛备受关注,众多开发者等参与。经初赛与评审,99 个优秀作品晋级决赛,企业组 41 支、高校组 58 支。总决赛 1 月 17 日在中科大苏州高研院举行。
国家级舞台,为你备好!首届“无限可能”AI短片创投计划-首创郎园专属投递通道正式开启!
首届“无限可能”AI短片创投计划由中制协主办,首创郎园开启推荐报名通道。该计划面向全球征集作品,分三阶段进行,旨在推选扶持AI创作者与项目,促进AI影视产业发展。
grok 4一图流
文章展示grok 4核心数据,涵盖训练成本、模型定价,还列举其在通用、专业、数学、推理、编程等能力测试中排名第一的成绩,不过实际水平还有待观察。
切开Claude大脑,Anthropic称发现了一个类似人类意识的内部空间
Anthropic在Claude模型中发现J空间,其与人类大脑全局工作空间理论相似,承载特殊内容且可干预、参与多步推理等,但模型和人脑有差异,研究也有局限性。
图像、视频一模搞定!字节全能原生多模态本地可部署
字节开源原生多模态模型Lance,仅3B激活参数,40G显存就能跑,已登顶huggingface趋势榜。它能进行图像与视频的理解、生成、编辑等操作,在多个基准测试中表现优异,多项性能居首。
可能是比Lovable还好的Vibe Coding产品-MiniMax Agent体验
作者测试MiniMax Agent,用其生成法国景点介绍、艺术家作品对比、攻壳机动队分析等网页。它能自主找信息、整理,生成图、音等。和Lovable对比,它表现更优,还支持免费试用。
Qwen2.5VL又多一个娱乐场景,看电影讲故事
文章聚焦Qwen2.5VL新娱乐场景“看图讲故事”。介绍视觉叙事目标、挑战,讲述基于StoryReasoning数据集微调Qwen Storyteller模型的解决思路,含核心技术,还给出实战代码及相关链接。
DeepMind 提出 CaMeL,抵御 LLM 提示词注入
谷歌DeepMind研究人员提出CaMeL,作为围绕LLM的防御层,通过提取查询中的控制流和数据流阻止恶意输入,能在AgentDojo基准测试中抵御67%攻击,采用传统软件安全原则。
别再手写 Skill 了!微软最新研究:像神经网络一样训练 Skill
微软研究提出 SkillOpt 方法,把 Skill 文档当「权重」训练,在 52 个测试组合中全部最优或并列最优,平均提升 23.5 分,碾压人类手写。该方法跨模型、环境有效,已开源,使用方便。