「多模态知识图谱」共找到 1408 篇相关文章
谷歌AI新里程碑:一个能「做研究」的系统诞生了,用LLM+树搜索编写专家级软件
谷歌提出能帮科研人员编写「专家级」科研软件的AI系统,融合大语言模型和树搜索,可整合重组知识构建新思路。在多领域超人类表现,但局限于可量化任务。
人类秒懂,AI崩溃:一个简单测试,就让GPT-5、Gemini等顶级模型集体“翻车”
来自多机构研究团队发现,OpenAI的GPT-5等顶级AI模型,面对‘看得见但读不懂’文字时表现极差。VYU团队实验显示,人类能轻松读懂的切分拼接文字,AI却全军覆没,原因是其靠模式匹配,不懂文字结构。
用“蒸汽机”生成视频,还能音视频一体化交付?
8月21日百度营销发布百度蒸汽机2.0,含多版本,有声版可音视频一体化交付。经测试,其生成视频细节佳、运动规律合理。它能解决影视业诸多痛点,成本低,还可免费使用。
演讲生成黑科技,PresentAgent从文本到演讲视频
联合团队提出 PresentAgent,能将长篇文档转化为带解说演示视频。采用模块化流程,还引入 PresentEval 评估框架。实验显示其接近人类表现,优于现有方案,展现了多模态智能体潜力。
o1核心贡献者离职后首发声:AI是史上最强杠杆,超越人力、资本和代码
刚被曝加入Meta的前OpenAI核心研究员Hyung Won Chung,分享对AI未来的思考。他认为AI是最强大杠杆,能成个人能力倍增器,智能体开启无需许可的复合杠杆,还能推动人类科学进步。
一键实现PPT演讲自由!「解说音频+视频」同步生成,效果逼近真人
澳大利亚与英国研究人员提出文档到演示视频生成任务,推出PresentAgent系统。它能将长文档转为带语音和同步幻灯片的视频,流程可控且适应多领域。实验显示其生成视频接近人类表现,还设计了双路径评估策略。
谷歌T5Gemma重燃架构之战!「套壳」反杀Gemma本尊,9B推理快得离谱
2023年以来大模型战场由decoder - only架构主导,Google双线出击。T5Gemma重燃encoder - decoder架构战火,性能提升显著;MedGemma坚守decoder - only路线,强攻医疗多模态,击穿闭源壁垒,打响开源反击战。
鹅厂人的2025上半年必读书单推荐|大牛书单
鹅厂同事认为AI时代程序员无需死磕工具书,但不能放弃系统性学习,应策略性地用书籍搭建知识骨架、AI填充细节、项目实践注入灵魂,还精选了2025上半年大牛书单。
奶牛版 Oura 估值 10 亿美金,AI+PDF 让它拿了 1700 万美金融资
市场上多数AI PDF产品是ChatPDF模式,用于C端。企业关键非结构化数据多在PDF等传统载体中,难以获取。硅谷工程师做的Extend AI产品,获1700万美金融资,解决传统文档处理难题,打造平台。
10 人 1600 万美金 ARR,华人团队 OpenArt 用了这 11 个 AI 技术栈
华人团队 OpenArt 10 人团队做到 1600 万美金 ARR,CEO Coco Mao 分享经验。包括找准定位,聚焦三类核心用户;用程序化 SEO 实现增长;战略转型做视觉故事讲述;解决角色一致性问题,还介绍多方面技术栈。