实时数据开发」共找到 4135 篇相关文章

产品应用7

一站式智能分析引擎,快速构建企业级数据分析 Agent

数据驱动的商业环境中,传统数据分析流程有诸多局限。本文介绍基于阿里云实时数仓 Hologres 和阿里云百炼的联合方案,结合 Function AI 平台,可构建企业级数据分析 Agent,实现端到端加速。

阿里云开发者
算法论文8

LLM的下一战:从狂卷数据到精算数据

大模型竞争核心正从比拼数据规模转向数据使用效率和风险管理。文章分享2025两篇论文,介绍高效训练和机器遗忘两赛道,前者有数据价值飞轮5大模块,后者提出三时段分类法、三层次遗忘及评价指标全景。

PaperAgent
开源动态8

还在为AI数据发愁?张文涛和鄂维南院士团队推出Data-centric AI系统

近年来大模型发展由科技公司主导,其数据资源不公开,学术界构建优化数据难。张文涛和鄂维南院士团队推出DataFlow系统,可实现数据治理,有算子和流水线,支持文本模态,多模态版待推出。

机器之心
开源动态7

直播实时离线翻译

传统离线翻译模型有延迟问题,GitHub上NoLanguageLeftWaiting开源项目把Meta的NLLB模型改造成实时同传模型,能边听边译,支持200种语言互译,还在开发推测解码功能提升速度。

GitHubStore
新闻资讯7

5个月估值翻10倍,AI数据赛道跑出一家新独角兽

成立约18个月的AI训练数据公司AfterQuery正筹新一轮融资,估值达32亿美元,5个月涨超10倍。它最初想开发AI智能体,后转收集训练材料。此赛道已有多家高估值公司,且数据隐私和安全风险待解。

DeepTech深科技
算法论文8

图像编辑缺训练数据?直接从视频中取材,仅用1%训练数据实现近SOTA效果

百度研究人员提出将图像编辑视为退化的时间过程,Video4Edit利用视频预训练模型知识迁移,仅用主流编辑模型约1%监督数据,在图像编辑任务达近SOTA效果,解决数据稀缺与权衡难题。

量子位
算法论文8

TACL 综述 | 别只卷架构了——长文本模型的能力天花板,其实是数据决定的

该 TACL 综述首次从数据视角审视长上下文语言模型,指出长上下文能力本质是数据驱动。它建立分类体系,明确高质量长文数据条件,给出核心能力的数据配方与评估法,还整理数据集和基准,提出待解问题。

深度学习自然语言处理
产品应用8

具身智能的无本体数据,终于有了自己的「代表作」

自变量机器人发布的Demo中,机器人用数百条无本体数据完成化学实验。其发布的TwinDEX系统由无本体数据采集系统和机器人末端执行器组成,能让无本体数据获接近真机数据的训练效果,重新定义数据采集逻辑。

AI科技评论
新闻资讯7

数据困局下的具身智能,谁能率先破局?

具身智能面临数据困局,Skild AI 关注真实数据不足难题。学者 Levine 称只有真实数据能达通用具身智能,而王鹤认为合成数据可助具身智能冷启动和规模化发展。遥操作和 Sim2Real 是不同技术路线。

机器之心
开源动态7

从社区数据出发,再看大模型开源开发生态全景与趋势

蚂蚁开源先后在527蚂蚁技术日和外滩大会发布大模型开发生态开源项目全景图1.0和2.0版本。2.0版更新评估方法,呈现生态新变化,还分析技术趋势、开发者分布,提及项目进出情况及TensorFlow衰落等。

InfoQ