「高质量输入」共找到 2440 篇相关文章
视频字幕处理开源神器
卡卡字幕助手(VideoCaptioner)操作简单,无需高配置,支持 API 和本地离线语音识别,利用大语言模型处理字幕。它支持多平台视频下载处理,有专业语音识别引擎,能智能纠错、高质量翻译、调整字幕样式。
用「进化+压力测试」自动生成的竞赛级编程题,各家大模型谁更hold住?
北京大学与通用人工智能研究院联合提出 UniCode 框架,构建进化式评测系统,能自动生成高质量算法题目与抗污染测试用例。通过对 19 个前沿大模型测试,展现高挑战性与强判别力,为代码能力评估开辟新路径。
3.4K星Apple出品FastVLM:视觉TTFT效率提升85倍,凭啥这么牛!
文章指出VLM在实际生产应用中因高分辨率图像存在效率问题,介绍Apple出品的FastVLM解决方案,阐述其架构、训练过程,展示在多个基准测试的性能,凸显在高分辨率输入下提升效率的优势及实际应用价值。
Sora被拉下神坛:PixVerse这款AI视频工具用最低价拿下全球质量第一
所有人以为Sora是AI视频生成天花板,但现在质量排名第一的是PixVerse,它登顶Product Hunt日榜第一。其质量评分超Sora 168分,价格还低20%,且在多方面升级。大众仍认为Sora最强有认知、品牌、信息等因素。
4000万样本炼出AI读心术,刷新七榜SOTA,最强「人类偏好感应器」开源
Skywork-Reward-V2全新发布,构建超高质量千万级人类偏好样本,刷新七大评测基准SOTA。8款模型覆盖6亿至80亿参数,小体积也能媲美大模型性能。团队引入多样大规模真实人类偏好数据,提升数据规模与质量。
BookRAG:专治各种「层次化复杂」文档
BookRAG专为处理层次化复杂文档而生。传统RAG有两大盲区,而BookRAG在多模态长文档基准上刷新SOTA。它采用BookIndex×Agent - based Retrieval技术方案,效率高、可扩展性强,兼顾高精度、高召回、低成本。
Manus高溢价收购背后,是Agent开发落地困境
近期Meta 20亿美元收购Manus引发关注,暴露Agent开发落地难题。阿里云百炼升级“1+2+N”体系,“N”组件解决数据、安全等问题,“2”提供新开发范式,“1”深挖模型服务工程,还发布企业版助力落地。
精准复刻!字节推出X-UniMotion实现高精度动作模仿合成
字节推出的X-UniMotion代表角色动画技术突破,提供统一运动控制系统,融合先进算法与操作界面,构建强大技术架构,能生成自然流畅角色动作,还介绍了其技术原理、演示对比等内容。
黄仁勋联手OpenAI前高管,1吉瓦超级算力明年开闸
英伟达CEO黄仁勋与前OpenAI高管Mira Murati的初创公司Thinking Machines Lab达成「吉瓦级」合作,将部署至少1吉瓦下一代NVIDIA Vera Rubin系统,明年初启动,背后涉及数百亿美元,也引发对「循环融资」的担忧。
面向 AI Agents 的高性能数据基座:架构和工程实践
在 QCon 全球软件开发大会上,晨章数据创始人陈亮分享了面向 AI Agents 的高性能数据基座。他指出 AI Agent 驱动的应用带来数据挑战,提出多模态数据基座设计目标,并介绍工程实践,证明传统架构有 CPU 瓶颈。