「可灵2.5」共找到 6688 篇相关文章
Agent失忆怎么办,Anthropic教你做好工作交接
文章指出AI Agent跨上下文窗口执行长任务时易失败,Anthropic用Opus 4.5实验发现,问题根源是交接差。解决办法是让Agent像人类工程师一样留文档、进度和测试,拆分流程,严格规范,提升测试覆盖率。
Google Stitch神了,我做周杰伦《太阳之子》播放器,2分钟后感叹前端彻底凉了
作者用Google Stitch两分钟做出周杰伦《太阳之子》音乐播放器网站,感叹前端要凉。Stitch可根据自然语言生成高保真UI,与Firebase Studio、AI Studio形成闭环。这使前端开发门槛消失,也让Figma股价下跌并推出MCP。
「百万级」视频推理数据集!30+顶尖高校联合发布
AI视频生成已能「画得像」,但不会「想得对」。VBVR推出百万级视频推理数据集,首次系统评测模型对空间、物理、逻辑和抽象的推理能力,发现顶尖模型通过率仅68%,推动视频AI从「视觉模仿」迈向「智能推理」。
哈佛物理教授疯了:我让AI写论文,结果两周干完博士一年工作!已发顶刊
哈佛物理学教授Matthew Schwartz指导Claude 4.5,两周产出顶刊级量子场论论文,人类博士生则需一两年。实验中AI展现能力也暴露问题,教授总结其优缺点及应对心法,还探讨人类科研人员未来。
刚刚,全球视频模型新王诞生了!
天工AI的SkyReels-V4直接登顶Artificial Analysis文转视频全球榜,超越Veo 3.1、Sora 2。其相比之前有两大核心升级,让视频生成从‘生成片段’走向完整视频生产,还应用于短剧平台DramaWave。
痛点突破:YOLOv26引入AAttn区域注意力机制,精度提升1.3个百分点
文章介绍YOLOv26引入AAttn区域注意力机制,解决传统机制在复杂场景下的不足。它通过划分特征图区域学习权重,提升检测精度,且实现简单。经实验验证,精度提升显著,还给出实现细节与优化建议。
具身智能中的 VLA 技术及其应用
文章围绕具身智能中 VLA 技术展开,介绍其现状、挑战、架构、数据方案及部署等内容。指出 VLA 虽推动具身智能发展,但面临数据、模型结构等挑战,还探讨了不同架构优劣及未来探索方向。
从多模态大模型中「拆」出音频向量模型
Google 发布原生多模态向量模型 Gemini Embedding 2,推动 Omni Embedding 发展。Jina AI 团队分享从多模态大模型中「拆」出音频向量模型的经验,介绍架构、训练数据,对比四种做法,还提及评测、应用场景及结论。
我们做了比你更懂 Java 的 AI-Agent -- Arthas Agent
Arthas是强大的Java诊断工具,但门槛高。Arthas Agent可将自然语言意图转化为Arthas操作,输出诊断报告。它技能优先、安全优先、循证闭环,通过多案例展示其诊断优势,还介绍使用方法和提效建议。
海外华人15人团队打造,统一理解与生成的图像模型,超越Nano banana登顶图像编辑
海外AI初创公司Luma发布图像生成模型Uni-1,将「理解」与「生成」统一,在多任务测试中表现优于GPT Image 1.5和Google Nano Banana Pro。它采用独特架构,提升理解能力,由华人团队打造。