「技术成年礼」共找到 4979 篇相关文章

算法论文8

大模型被确诊「视觉文盲」!多校联合提出MILO,为它植入空间想象力

空间推理是多模态大语言模型(MLLMs)应用关键挑战,当前‘语言描述式调优’让模型成‘视觉文盲’。多校联合提出MILO范式,结合视觉生成反馈与语言调优,还构建GeoGen数据集,经五大任务验证其有效。

量子位
新闻资讯7

奥特曼恩师力挺19岁少年!比AlphaFold快4倍,只杀害虫不伤人

2024年,18岁的Tyler Rose和19岁的Navvye Anand创办Bindwell,将AI药物研发技术用于农业,构建基础模型,研发出比AlphaFold快4倍的模型。奥特曼恩师Paul Graham建议卖知识产权授权,公司获600万美金融资。

新智元
新闻资讯8

马斯克想要「杀死」氛围编程,就像FSD搞定自动驾驶

马斯克在X平台称xAI将消除氛围编程,让它回归纯粹编程,能按描述制作应用。氛围编程借助AI根据自然语言指令自动生成代码,若xAI愿景成真,软件开发范式或转变,程序员工作模式也将改变。

新智元
推荐文章8

从检测到通用感知:构建空间智能的基础

本文整理自张磊在AICon 2025北京的分享,分析语言与视觉原生模型架构区别,介绍基于Transformer的物体检测算法及开集检测技术进展,如Grounding DINO和DINO - X,还探讨其在多领域的应用和潜力。

InfoQ
产品应用7

实测完“灵光”,我意识到人类对 AI 助手的开发不足1%

作者实测蚂蚁集团的AI应用「灵光」,它是面向普通人的零门槛全模态AI助手,能30秒生成可互动小应用。作者测试其三大功能,认为人类对它的开发不足1%,它或成探索世界的伙伴。

AI科技评论
8

年度最强AI压轴!谷歌Gemini 3.0下周决战OpenAI,前端要下岗了

谷歌CEO疑似暗示Gemini 3.0下周登场,它或成谷歌重大转折点。其在代码编写、图片生成等方面表现出色,还能一句话生成OS、UI网页。谷歌与OpenAI竞争激烈,巴菲特重仓谷歌股票,业界看好其潜力。

新智元
开源动态8

NVIDIA 开源 Live VLM WebUI:摄像头实时测试视觉语言模型

NVIDIA 开源 Live VLM WebUI,可让用户在本地用摄像头实时测试视觉语言模型。它基于 WebRTC 技术,能将摄像头视频流实时传输给模型,分析结果叠加在画面上,支持多后端、多平台及多种模型。

AI工程化
开源动态8

音画同步视频生成重磅开源!Character AI和耶鲁大学推出Ovi,让音、画在一个大脑里思考

Character AI和耶鲁大学团队推出开源模型OVI,它采用双骨干交叉模态融合架构,让音视频同步生成。其架构对称,用旋转位置嵌入技术对齐时间,训练策略分步进行,生成效果佳,为开源音视频生成提供新路径。

AIGC开放社区
开源动态8

RLinf上新πRL:在线强化学习微调π0和π0.5

近年来,基于流匹配的VLA模型成机器人领域前沿技术,但训练依赖大量人类演示数据。清华等机构联合推出在线强化学习微调框架πRL,提出两种微调方案,在测试平台验证了有效性,目前代码等已开源。

机器之心
新闻资讯7

极佳视界获新一轮亿元级 A1 轮融资,CEO:“物理世界 ChatGPT 时刻”将在 2 至 3 年内到来

近日,极佳视界完成新一轮亿元级 A1 轮融资,由华为哈勃、华控基金联合投资。该公司聚焦物理 AI,其创始人兼 CEO 黄冠博士称‘物理世界 ChatGPT 时刻’2 至 3 年内到来,世界模型技术价值已现。

AI前线