数据集构建」共找到 4069 篇相关文章

新闻资讯8

从李飞飞到朱军,世界模型为什么都开始走向机器人|甲子光年

本文报道近期多位AI领军者均将世界模型研究转向机器人领域,梳理了朱军团队通用世界模型的五级技术路线,解析世界模型从生成世界走向真实行动的核心逻辑与行业趋势。

甲子光年
新闻资讯8

让龙虾看懂屏幕!谷歌多模态新成果,文本图像视频音频进同一空间

谷歌发布首个原生多模态嵌入模型Gemini Embedding 2,将文本、图像、视频、音频和文档映射进同一嵌入空间,支持多模态混合输入,为AI Agent“看懂”世界提供关键基础,已展开公测。

量子位
开源动态8

刚刚,DeepMind开源全栈「Deep Research」项目,AI 研究将人人可用

谷歌DeepMind团队开源基于Gemini 2.5的全栈「Deep Research」项目,能让每个人拥有智能研究助手。它可动态搜索、反思结果,以流式传输提供带引用答案,前后端结合,还介绍了特性、原理、技术栈等。

AGI Hunt
开源动态7

250美元起售,还开源,Hugging Face 发布史上最亲民人形机器人

Hugging Face 开源两款人形机器人 HopeJR 和 Reachy Mini,前者全尺寸有 66 个驱动自由度,售价约 3000 美元;后者成本低至 250 美元,可用于测试 AI 应用。虽被指外观不佳,但推动开源机器人生态发展。

机器之心
开源动态8

刚刚开源的学术论文阅读神器,AI 驱动的个性化“暴躁教授”助你攻克论文!

学术论文阅读常因晦涩内容和语言壁垒让人望而却步。Mad-Professor是开源的AI驱动学术论文阅读工具,成多种功能,通过AI问答和语音交互解答疑惑,赋予个性化角色,让阅读体验高效且生动。

开源星探
开源动态8

14.9k Star!Firecrawl 开源的 PDF 智能分类器,200 份文档 0.47 秒搞定!

Firecrawl 开源 PDF 智能分类与文本提取库 pdf-inspector,已获超 1.4 万人标星。它能智能分类、感知提取、转 Markdown 及按需路由,性能炸裂,分类快,多项指标领先,还支持多平台。

开源星探
开源动态7

刚刚微软开源视频录制技能skill-recorder

微软开源视频录制技能 Skill Recorder,能将用户完成任务的过程转化为 AI 智能体可重复执行的技能。它捕获屏幕工作会话,用 GitHub Copilot CLI 重构操作,生成可复用内容,支持多平台。

GitHubStore
开源动态8

夯,开源 LiteParse,没有对手的 PDF 解析工具,知道的太晚了!

LlamaIndex团队开源独立工具LiteParse,用Rust打造,可本地运行、零成本、高精度解析PDF。它能提取文本及精确位置,有多种输出格式,支持多格式输入,还介绍了安装、使用、OCR配置等内容及应用场景。

小华同学ai
产品应用7

大规模工程支撑场景下的多智能体系统设计:Grab 实践案例

Grab分析数据仓库(ADW)团队推出多智能体AI系统,处理数据仓库故障排查等工程请求,减少重复性运维。团队搭建多智能体架构,整合工具生态,考虑安全治理,解决上下文管理挑战,提升工作效率。

InfoQ
推荐文章8

OpenAI 发布《在AI 时代保持领先》企业实战白皮书

OpenAI发布《Staying ahead in the age of AI》白皮书,用数据凸显AI发展态势,基于合作经验总结出Align、Activate、Amplify、Accelerate、Govern五个实战原则,助企业应对AI浪潮。

AGI Hunt