「全局因果任务图」共找到 2057 篇相关文章
神秘模型「大象」:仅100B拿下SOTA,Token效率超高!
神秘模型「大象」面纱揭开,它出自蚂蚁Inclusion AI团队,仅100B大小,是同规模SOTA且省Token。经多方面实测及权威榜单评测,它快、准、省,能胜任多数日常工作,但也有不擅长的领域。
迈向无缝共生:大模型GUI Agent的「屏幕图灵测试」与拟人化之路
多模态大模型使GUI Agent能模拟用户执行任务,但也引发与平台的利益冲突。论文提出“屏幕图灵测试”和AHB基准评估拟人化能力,探讨拟人化策略及权衡,为Agent在数字世界共生提供指南。
24小时、78轮实验、持续迭代,AiScientist自己把最优解一步一步逼出来了
中国人民大学高瓴人工智能学院的AiScientist挑战让AI持续推进研究工程。它采用“thin control over thick state”设计,通过分层编排和File - as - Bus等方式,在多任务上表现出色,为AI科研工程补上关键底座。
重构线性视觉Transformer,精度与效率双平衡 | CVPR'25
南洋理工、北航与合工大联合提出CARE Transformer,以非对称解耦建模局部与全局,降低计算开销、提升特征表达。实验显示其在移动端低延迟高精度,打破“效率与精度不可兼得”困局。
刚刚,Meta 发布新模型,股价大涨 10%
Meta发布新模型Muse Spark,是原生多模态推理模型,支持多种功能。其沉思模式处理复杂问题表现佳,还有新购物模式。虽评论区有质疑,但Meta股价大涨。模型未开放API等,实际实力待察。
这个 skills 太硬核了,刚开源就斩获 1.7K Star!Agent 联网能力拉满!
AI开发者圈热议让AI助手真正“上网”,Claude Code原工具局限性大。web - access skill横空出世,从底层架构重新设计,解决其三大短板,让Claude Code可自由穿梭互联网,功能强大且安装使用方便。
告别单打独斗!ClawTeam-OpenClaw 一键 spawn 整个 AI 开发团队
ClawTeam-OpenClaw 是多代理协调框架 OpenClaw 深度适配版,让 AI 代理自动组队协作。它有一键 spawn 团队、智能任务依赖管理等功能,在科研、开发、投资分析场景优势明显,介绍了使用方法和项目地址。
做RAG这一年,最后悔的就是上知识图谱
基于知识图谱的检索增强生成在问答任务中存在三元组索引丢失上下文语义问题,作者提出MDER - DR双阶段框架,在标准测试和特定数据集上性能提升最高66%,还具备多方面优势。
OpenAI新模型Day0就被嫌弃!排名拉垮,不如一月底发布的国产模型
OpenAI推出GPT - 5.4 mini和nano模型,主打快速经济,针对编程等优化。但评测中GPT - 5.4 mini排名不佳,不如国产Kimi 2.5,且价格对比有争议。不过与自家旧版比有提升,网友测试有亮点。
The Batch:924|GPT-5.4:性能更高,价格也更高
OpenAI更新旗舰模型GPT-5.4,有Thinking和Pro两个版本,扩展工具使用能力,多基准测试达当前先进水平,但定价高。虽在部分任务表现超Claude,挑战Gemini地位,不过成本也更高。