「跨平台评测」共找到 2120 篇相关文章
Claude 吞噬整个AI编程栈?“Vibe Coding 公司的最大错觉是以为自己有护城河”
近日网友爆料Anthropic开发类似Lovable功能,可构建全栈应用。此前Claude Code源码泄露,展示其构建软件开发全流程“执行层”能力。AI编程进入“大收割时代”,模型厂商吞噬工具趋势显现,Lovable等平台护城河受挑战。
告别人工干预!KDD Cup 2026 Data Agents 赛道:定义下一代数据智能体能力边界
KDD Cup 2026 发布 Data Agents for Complex Data Analysis 赛道,由香港科技大学(广州)和清华大学联合承办。旨在推动 AI 告别人工干预,具备自主任务分解等能力,还推出 DataAgent - Bench 测试平台,有丰厚奖励,公布关键时间节点。
一条被开发者踩出来的路:OpenClaw“涌进”飞书
在中文社区,越来越多开发者将 OpenClaw 接入飞书,飞书接口生态开放且更新快。这波热度并非官方推动,开发者先实践,后飞书将路径官方化,补齐链路,其优势在于便捷实用,正朝“入口级”智能平台转变。
NVIDIA 开源 Live VLM WebUI:摄像头实时测试视觉语言模型
NVIDIA 开源 Live VLM WebUI,可让用户在本地用摄像头实时测试视觉语言模型。它基于 WebRTC 技术,能将摄像头视频流实时传输给模型,分析结果叠加在画面上,支持多后端、多平台及多种模型。
红杉中国xbench全球首发,AI智能体真实战力揭榜!
红杉中国推出全新AI基准测试工具xbench及相关论文,采用双轨评估体系和长青评估机制,首期发布两个核心评估集并综合排名,还提出垂类评测方法论。它能追踪模型能力与实际场景价值,解决现有评估难题。
速戳!2026中国科幻大会北京未来数字空间创新试验区产业引领论坛亮点抢先看
2026第十届中国科幻大会将在北京首钢园召开,“北京未来数字空间创新试验区产业引领论坛”3月29日亮相。论坛有四大亮点,包括“街区式”创新平台亮相、“三重智能”协同勾勒技术路线等,还汇聚多方资源构建产业创新生态。
比肩Claude Opus:阶跃星辰最强模型Step 3.5 Flash发布
阶跃星辰发布最强模型 Step 3.5 Flash,参数强大,性能与前沿顶级大模型并驾齐驱。其架构平衡算力与智力,有独特注意力布局;基础设施保障训练稳定;强化学习激发智能体潜能;评测数据显示战斗力强,未来还将持续优化。
苹果画的饼谷歌率先搞定!Gemini全面进驻全家桶,连鼠标都AI上了
在Android Show独立发布会上,谷歌推出诸多新品,核心是将Gemini嵌入安卓底层,还带来AI鼠标光标、Googlebook等。Gemini能跨应用执行任务,Googlebook为其量身打造,谷歌这波操作像把苹果画的饼烙好端上桌。
指导Harness的越多,收益反而越差
Thinking Machines Lab的《Interaction Models》指出,当下产品形态中,指导harness越多收益越差。问题在协作带宽,提出把“会交互”练进模型本体,介绍了从零训练的interaction model及架构,还指出现有交互评测不足。
AI短漫剧的Netflix来了!恒星AI推出全球首个影视级AI Agent「Starfilm」,打造AI短漫剧制作的“超级梦工厂”
恒星AI推出全球首个影视级AI Agent「Starfilm」,能一站式完成AI短漫剧创作。它集剧本、数字人、音乐等核心能力,还搞“星光计划”助力创作者在多平台分发变现,让“一人成剧”梦想成真。