视觉推理任务」共找到 3940 篇相关文章

开源动态8

奥特曼深夜官宣:OpenAI重回开源!两大推理模型追平o4-mini,号称世界最强

OpenAI深夜推出gpt-oss 20B和120B两款开源模型,性能比肩o3-mini和o4-mini,能在消费级显卡甚至手机运行。有宽松许可证等亮点,还准备了体验网站。这是自GPT - 2后首次开源,降低了部分群体准入门槛。

新智元
产品应用7

理解归 AI,正确归引擎:从一句话到一条实时数据链路(0代码搭建实时任务

文章分享直播数据团队搭建AI辅助、指标驱动的实时数据端到端开发系统的实践与思考。从案例介绍用户使用流程,再深入系统内部讲链路构建与演进,阐述设计方法论,最后提出未来规划。

阿里云开发者
产品应用8

生数科技认领神秘登顶模型:AI视频公司拿出工业级Demo,跨本体跑通复杂长程任务

生数科技认领神秘登顶模型MotuBrain,该模型4月中旬悄登两国际benchmark。它将预测与行动统一,具一脑多型等能力,技术上走边看边动路线,有响应快等优势。生数科技双轨布局,Vidu与MotuBrain同根。

量子位
开源动态8

全景视觉的Depth Anything来了!Insta360推出DAP,200万数据打造全场景360°空间智能新高度

Insta360等团队推出全景度量深度基础模型DAP,构建200万量级全景数据引擎,设计三阶段伪标签管线,在模型架构上也有创新,在多项测试中效果优异,项目代码与模型已开源。

机器之心
算法论文8

告别高昂重制成本!港科大广州、快手可灵发布立体视频转换单步推理新方案

随着 3D 设备发展,人们对 3D 立体视频需求增加,但高昂制作成本成阻碍。快手可灵与港科大广州团队联合提出 StereoPilot 模型,能快速将 2D 视频转为高质量 3D 视频,还构建了 UniStereo 数据集。

机器之心
算法论文8

突破单token预测局限!南洋理工首次将多token预测引入微调,编程任务准确率提升11.67%

当前主流大语言模型依赖下一token预测训练,难理解跨多token完整概念。南洋理工大学提出概念感知微调(CAFT)技术,首次将多token预测引入微调,能让模型理解完整概念,多领域实验显示其可显著提升模型性能。

量子位
开源动态8

机器人视觉语言导航进入R1时代!港大联合上海AI Lab提出全新具身智能框架

香港大学与上海AI Lab联合提出VLN - R1,可将自然语言指令转化为连续导航动作,打破传统链条。它有两阶段训练等创新支柱,在测试中表现出色,小模型性能佳,推动具身智能从数字向具身认知跨越。

量子位
推荐文章7

一个任务50次调用,成本狂砍90%?Manus首次公开上下文工程秘诀,一堆反复重写换来的教训

Manus项目团队分享上下文工程秘诀。他们押注于此,使产品发布改进更快。还阐述围绕KV缓存设计、掩码非移除工具、用文件系统作上下文等原则,助构建AI Agent者少走弯路。

AI前线
开源动态8

谷歌T5Gemma重燃架构之战!「套壳」反杀Gemma本尊,9B推理快得离谱

2023年以来大模型战场由decoder - only架构主导,Google双线出击。T5Gemma重燃encoder - decoder架构战火,性能提升显著;MedGemma坚守decoder - only路线,强攻医疗多模态,击穿闭源壁垒,打响开源反击战。

新智元
算法论文8

AI玩宝可梦找出30年前代码Bug!谷歌论文介绍AI通关全过程,复杂任务都能解

谷歌Gemini 2.5系列技术报告花长篇幅介绍Gemini 2.5 Pro玩《宝可梦蓝》,它通关游戏,展现出创造力与长期规划能力,还发现游戏代码Bug,但也有幻觉、思维定势等问题。Claude 4已加入比赛。

量子位