「多视角数据」共找到 6017 篇相关文章
千亿多肽市场迎来Scaling时刻,清华校友创业用AI重写发现规则 | 对话利太智药贾寅君
本文对话利太智药贾寅君,他从临床医学转向AI药物发现,创业聚焦多肽。他认为多肽泛用性强,能覆盖更多靶点。其团队构建合成数据,开发模型,如MEET、PepMirror,探索将技术落地成药。
基于文本AI的终结?Agent协作可直接「复制思维」,Token效率暴涨
在 Agentic AI 时代,多智能体系统让 AI 从单打独斗变为团队协作。普林斯顿大学等机构研究者提出多智能体推理框架 LatentMAS,将协作从 token 空间转移到潜在空间,实验显示其性能、效率大幅提升。
全球仅9所,清华姚班校友当选!亚马逊AI博士奖学金豪掷6800万美元
亚马逊官宣AI博士奖学金,两年共6800万美金,为全球九所顶尖大学100多名博士生提供支持,资助智能体系统等硬核方向。目前,MIT、CMU、UC伯克利公布获奖名单,多位华人学者入选。
超越纯视觉模型!不改VLM标准架构,实现像素级深度预测
Meta开源DepthLM,首证视觉语言模型不改架构就能媲美纯视觉模型的3D理解能力。通过视觉提示等创新策略,它精准完成像素级深度估计等任务,为多领域带来前景。
阿里再开源,全球首个MoE视频生成模型登场,电影级美学效果一触即达
继上周开源三连发后,阿里昨晚开源全球首个 MoE 架构视频生成模型 Wan2.2,具电影级美学控制能力。它有 MoE 架构创新等四大技术亮点,可在 Hugging Face 和阿里魔搭社区下载。
为了训练AI,Meta强制监控了员工的鼠标和键盘
近日,Meta宣布在美国员工电脑装追踪软件,记录鼠标、键盘操作及截取屏幕内容,用于训练AI。这引发员工愤怒,Meta CTO称员工无法退出。Meta AI投入大,此举或因缺训练数据,但也被质疑是在训练替代者。
2.12页/秒,MinerU2.5太快了,1.2B硬刚腾讯、阿里
GPT - 4o等刷新OCR榜单,但产业界仍面临文档图像处理难题。MinerU2.5提出1.2B轻量级文档解析模型,采用创新解耦范式,在多基准测试表现出色,单卡吞吐快,还给出可借鉴创新点。
4K超分Agent修图师来了!一键救活所有模糊照片
传统图像放大模型应对复杂情况力不从心,4KAgent应运而生。它基于多智能体设计,有感知、复原等模块,能为图像定制4K超分方案,在多领域测试中表现出色,无需特定领域再训练。
BigBang-Proton: 自回归基座模型统一语言、科学和物质世界
超对称公司发布新版基座模型 BigBang - Proton,实现多学科问题与 LLM 统一预训练和推理,挑战主流 AGI 技术路线。它有三项创新,在多专业学科任务表现出色,还提出宇宙尺度压缩构想。
港大联手月之暗面等开源OpenCUA:人人可造专属电脑智能体
香港大学 XLANG Lab 和月之暗面等多家机构提出用于构建和扩展 CUA 的完全开源框架 OpenCUA,含注释工具、大规模数据集等,还构建旗舰模型 OpenCUA - 32B,公开代码、数据和模型。