「自监督预训练」共找到 3068 篇相关文章
边画边想!多模态Reasoning迎来巨大提升!
论文指出文本无法精准表达空间关系,现有视觉语言模型(LVLM)在空间推理上是短板。ViLaSR让模型直接画图推理,经三阶段训练,在五大空间推理测试中表现出色,还开源资源,有望带来机器认知升维。
Ψ₀刚刚开源了!迈向通用人形机器人的基座模型
南加州大学团队开源迈向通用人形机器人的基座模型Ψ₀,仅需80条真机遥操作数据,在总体任务成功率和子任务指标上平均领先NVIDIA最新开源模型GR00T N1.6超40%,还介绍了其数据、训练、架构等方面。
大规模替换数据库序列,保障百余个服务平稳运行
Coupang从关系型数据库迁移到NoSQL时,为解决序列替换问题,自研了专用解决方案。该方案采用双层缓存与滑动窗口预填充机制,以DynamoDB为数据源,让百余个服务无需重写代码完成迁移,性能和成本表现佳。
40倍推理加速!复旦&微软:用「非线性流」拟合复杂轨迹,2步生成媲美原画
ArcFlow是复旦与微软提出的图像生成加速方案,引入非线性流拟合复杂轨迹。它在仅2步推理下保持画质,实现约40倍推理加速和4倍训练收敛加速,微调极少参数,在多模型验证效果出色。
Clawdbot 之后,我们离能规模化落地的 Agent 还差什么?
OpenClaw爆火,但在企业和商业环境中存在昂贵、不可控等问题。Monolith砺思资本技术沙龙探讨Agent规模化落地难题,指出需关注稳定性等指标,还分析了数据成本、训练速度、基础设施、状态管理等方面的困境与解决思路。
英伟达Thor芯片屡屡延期:车企被迫转身,供应链迎来机遇
英伟达原计划的Thor芯片因架构和设计缺陷多次跳票,性能大幅缩水至约700TOPS,打乱国产车企规划,小鹏、理想等厂商回调旧方案或加速自研。同时,也为国产芯片企业带来机遇,推动市场走向多元竞争。
开源模型首次物理奥赛IPhO夺金!上海AI Lab 235B模型击败GPT-5和Grok-4
上海AI Lab的P1 - 235B - A22B在国际物理奥林匹克竞赛夺金,在HiPhO基准测试获12金1银,超越GPT - 5等闭源模型。团队构建HiPhO基准测试,用多阶段强化学习训练模型,开发PhysicsMinions系统提升推理能力。
社区供稿 | 阿里国际Ovis2.5重磅发布:以小博大,刷新开源模型性能新高度
阿里国际发布多模态大模型Ovis2.5,在OpenCompass综合得分提升,保持SOTA水平。它在原生分辨率视觉感知等三方面突破,有9B和2B两版本,代码、模型等资源已开源,技术原理涉及架构、训练与数据。
百度:和大家一起讲 「超级有用」的故事
作者参加百度AI DAY智能云创新行业专场,看到百度全栈AI解决方案矩阵及应用案例。百度通过构建生态、全栈自研、推动科技平权等举措发力AI,诸多应用已取得商业成果,有望在AI商业化长跑中胜出。
困住医疗AI的死循环,终于有国产玩家跑通了
文章指出医疗AI行业因数据、模型、场景闭环断裂陷入困境,整体渗透率低。讯飞医疗的星火医疗大模型V3.5评测和临床落地表现出色,其构建自强化循环体系,跑通死循环,或使行业马太效应渐显。