「代码能力」共找到 4463 篇相关文章
理解归 AI,正确归引擎:从一句话到一条实时数据链路(0代码搭建实时任务)
文章分享直播数据团队搭建AI辅助、指标驱动的实时数据端到端开发系统的实践与思考。从案例介绍用户使用流程,再深入系统内部讲链路构建与演进,阐述设计方法论,最后提出未来规划。
国内首套:港中文团队发布7模态人体动作数据集,揭开大模型理解能力短板
港中文邢国良教授团队博士生蒋思阳完成 CUHK-X 多模态人体动作数据集,成果被 ACM MobiSys 2026 接收。用其测试主流大模型,发现理解人类动作平均正确率仅四成。该数据集数据收集方法反常规,还开展了基准测试。
每周产业洞察 | AI音视频赛道现“隐形冠军”小众需求催生健康商业模式,工程能力成盈利分水岭
北京AIGC视听产业创新中心位于朝阳区,是朝阳区推动影视制作基地建设举措。由多方参与,首创郎园运营,提供六大服务平台,截至2025年8月汇聚60余家合作伙伴。首创郎园拓展服务边界,项目延伸多地。
混元3D开源端到端全景深度估计器,代码+精选全景数据已上线,在线可玩
全景深度估计在3D视觉领域日益受关注,但因全景数据稀缺、球面畸变问题,以往方法零样本泛化和效率不佳。腾讯混元3D团队提出DA²,通过数据扩充引擎和SphereViT架构,提升性能,展现SOTA表现。
全球AI视频大战升级!「中国版Sora」Vidu Q2参考生月底发布,能力对标Sora 2
OpenAI的Sora 2引发全球AI视频狂欢,而国产AI视频Vidu将在本月底升级Vidu Q2参考生功能。Vidu起步更早、覆盖广,在一致性、运镜理解、动作连贯等维度优势明显,月底升级值得期待。
仅10行代码,轻松打通你的AI应用与DB:谷歌开源数据库MCP,Star突破4.6k
谷歌开源面向数据库的MCP Toolbox,位于应用编排框架和数据库间,处理连接池等复杂问题,简化工具管理。它能助开发者构建让智能体访问数据库的Gen AI工具,有开发简便等优势。
DeepMind 再放大招,AlphaGenome 能一次性处理百万碱基对,基因组里的“垃圾代码”这下藏不住了
Google DeepMind发布AI模型AlphaGenome,可预测遗传变异对基因调控的影响。它能处理百万碱基对,结合关键技术,性能顶尖,还能直接建模RNA剪接点,已面向非商业研究开放,引发医疗AI应用讨论。
美团提出首个语音交互GUI智能体,端到端语音训练能力优于传统文本训练
美团和浙大联合推出GUIRoboTron - Speech,这是首个能利用语音指令和屏幕截图端到端决策的自主GUI智能体。它解决了文本依赖问题,团队经多步骤研发,其性能评估表现佳,还给出招聘信息。
谢赛宁等推出统一多模态模型!替代VAE实现图像理解/生成双SOTA,代码权重数据集全开源
谢赛宁等团队推出统一多模态模型Blip3 - o,用扩散Transformer生成CLIP图像特征,采用顺序预训练策略。对比多种设计方案,确定CLIP + Flow Matching最佳,模型在多任务测试表现卓越且全开源。
3.3k星星!用AI做前端动效最好的开源项目,给AI写前端代码注入灵魂
现在AI编程做的前端效果不佳,页面不生动、特效生硬。而Text-to-Lottie开源框架可通过AI编程Agent快速生成生产级Lottie动画,支持多种输入,有实时预览与编辑功能,还能集成多平台,简化动效开发。