「人类智能」共找到 4312 篇相关文章
刚刚,ChatGPT Pulse上线!私人秘书不再是富人特权
OpenAI官宣ChatGPT Pulse上线,它改变LLM交互方式,从被动变主动。每晚研究,晨送简报,涵盖工作、生活、兴趣目标。其主动受用户控制,还给出三个试用场景。
用多模态LLM超越YOLOv3!强化学习突破多模态感知极限|开源
华中科技大学、北京邮电大学等多所高校研究团队共同推出纯多模态开源LLM——Perception-R1,该模型用强化学习优化视觉感知,目前论文和代码均已开源,其在视觉任务上表现出色,为后续研究提供强大baseline。
NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026
本文整理了NVIDIA Research科学家李柏依在ECCV 2026 Workshop的分享,针对机器人训练数据采集壁垒高的问题,介绍了两项解决多模态感知与灵巧操作数据难题的前沿研究。
翁荔最新博客:我们可能高估了模型,却严重低估了那层“脚手架”
前OpenAI安全研究副总裁翁荔在新博客聚焦AI领域Harness Engineering。她认为Harness是决定模型在现实任务中走多稳、多远的‘脚手架’,并梳理其演进路线,也指出研究面临评估、安全等瓶颈。
20岁了!劈柴哥发帖庆生:谷歌翻译换了4代AI,第一次有了「呼吸感」
4月28日,Google Translate满20岁,Pichai发帖纪念,回顾其技术发展,从统计模型到神经网络,再到Gemini原生语音模型,Translate不断进化,能保留语调和节奏,虽被大模型抢风头,但仍在持续进步。
打破视频推理「先看后想」惯性,实现真正的「边看边想」丨CVPR'26
现有大型视觉语言模型(VLM)在实时场景表现不佳,宁波东方理工大学沈晓宇团队提出TaYS,让VLM从“帧文交错”切换到“并行”,实现“边看边想”,在准确性和延迟上表现出色,推动VLM走向更真实应用。
本周 5 个超酷 GitHub 开源项目,实用到飞起!
本文介绍本周5个超酷GitHub开源项目。有显示苹果设备电池状态的AirBattery,开源卫星可视化平台keeptrack.space,本地图片压缩工具Pic - Smaller,跨平台端口助手Port - Killer,轻量级AI证件照工具HivisionIDPhotos。
“心内推理”:一种动态多模态潜在空间推理范式 | 直播预约
当前多模态大模型推理效率低、稳定性不足。本次分享将介绍DMLR,它无需额外训练,仅在推理阶段生效,通过在潜空间优化潜在思考token、引入关键视觉信息,实现高效稳定的多模态推理。
2026年AAAI Fellow名单出炉!清华校友田奇等4位华人学者入选
2026年AAAI Fellow名单出炉,12位学者当选,含4位华人,分别是南洋理工大学的Bo An、香港中文大学的Irwin King、南加州大学的Yan Liu和光明实验室的Qi Tian。AAAI将在会议期间的颁奖典礼上表彰他们。
OCR 创新技术解析丨AI Insight Talk 直播预告
在数字经济下,传统 OCR 技术面临诸多挑战。12 月 4 日 20 点,AI Insight OCR 专场直播将剖析三项突破性 OCR 技术方案,还会有圆桌对谈。分享嘉宾将介绍 HunyuanOCR、PaddleOCR - VL、MinerU 等模型亮点。