「多平台接入」共找到 5232 篇相关文章
AI 剪完整条视频,却没看过一帧:背后是所有 agent 都在用的套路
browser - use团队开源的video - use项目能让Claude自动剪辑视频,且AI不看视频帧,靠处理文本完成。这是当前聪明的agent产品通用做法,还给出判断AI agent的三个问题及思路。
Anthropic深夜连放两弹:Sonnet 5、全新AI科研App重磅上线
Anthropic 深夜发布两个重磅更新:Claude Sonnet 5和面向科研人员的AI工作台Claude Science。Sonnet 5性能接近Opus 4.8,提升Agent能力且价格低;Claude Science整合科研工具,支持复现产出、自动管理算力、多学科查询。
直接从像素到单词:这个原生大模型统一单图、多图、视频和空间智能
南洋理工大学等团队推出NEO - ov模型,挑战传统「视觉编码器 + 大模型」范式,直接从原始像素学语言。它在多任务表现出色,尤其空间智能突出,但在OCR等方面有短板,展现原生多模态建模潜力。
星海图创始人高继扬:具身智能三层技术路线,没有捷径可走
星海图在第一届全球开发者大会上,展示了其在具身智能领域的战略布局。提出100万小时超高质量真实数据计划,发布新一代VLA基础模型G0.5并开源,还联合发布创业孵化项目「星途计划」,探索三段式商业模式。
把AI 时代最重要的判断力当专业学科训练,专注提升判断力
文章指出AI时代人们多只有“领域内判断力”,判断力可当学科训练。介绍预测大赛中普通人表现超CIA分析师,1小时训练能提升10%准确度,还给出判断力3层栈框架及30天训练清单。
阿里财报+96%是假象:扒开数据,真利润只剩8600万
5月13日盘前阿里发布2026财年Q4财报,主流标题称净利润同比增96%,股价盘前一度涨7%。但经分析,扣掉投资浮盈后真利润仅8600万。文章还给出财报分析方法、释放的关键信号及投资建议。
谷歌推出Googlebook:为Gemini重新造一台笔记本
谷歌宣布推出全新笔记本产品线Googlebook,专为Gemini AI打造。它融合Android和ChromeOS体系,有Magic Pointer等新功能,与Android手机协作顺畅,还新增Quick Access功能,首批设备由多厂商合作生产,今年秋季发布。
完全运行在浏览器中的全功能 3D 建筑编辑器无需 AutoCAD\Revit,也无需每年 5,000 美元的授权费用,100%开源免费
Pascal Editor是完全在浏览器运行的3D建筑编辑器,开源免费,无需AutoCAD、Revit及高额授权费。它采用节点式场景结构,有多种特性,技术栈丰富,分层设计让核心逻辑可复用,性能优化亮点多。
DeepSeek视觉原语论文:当所有人在堆图像分辨率时,它在堆「指代精度」!
4月30日DeepSeek发布多模态论文,核心是“视觉原语”,让模型边推理边输出坐标。它是七大coding agent玩家中最后接入视觉的,但补课方式反共识,不堆分辨率堆指代精度,效率高,拓扑推理成绩领先。
5.2万Star项目被迫出走GitHub,但开源世界只剩更差的选择
Ghostty 项目创始人 Mitchell Hashimoto 宣布项目将逃离 GitHub,因其频繁故障影响工作。开发者群体对 GitHub 现状失望,认为平台重心转向 AI 产品致基础设施变差。但 GitHub 外的开源替代方案都有明显缺陷。