工具发现」共找到 2816 篇相关文章

新闻资讯8

烧2万亿美元却难用?Gary Marcus狂喷AI赛道不靠谱:推理模型只是“模仿秀”,OpenAI一年后倒闭?

知名AI专家Gary Marcus在访谈中称,世界在神经网络投入巨资,但大语言模型无法实现AGI目标。他指出其推理模型是“模仿秀”,会出现幻觉,还预测OpenAI或被微软收购。

AI前线
开源动态7

推出 AnyLanguageModel:在 Apple 平台统一本地与远程大语言模型的 API

大语言模型是构建现代软件的重要工具,但 Apple 平台开发者集成模型困难。Hugging Face 发布 AnyLanguageModel,是 Swift 包,可替代 Apple Foundation Models 框架,支持多模型服务商,降低使用 LLM 难度。

Hugging Face
新闻资讯8

Science重磅:AI编程新手与资深开发者之间的差距巨大

《科学》杂志发表的AI编程全球调查研究显示,美国程序员提交的Python代码中29%由AI代笔,资深开发者借此拉大与新手差距。研究团队用GraphCodeBert模型分类器扫描代码,揭示技术扩散差异与隐忧。

AIGC开放社区
开源动态7

AgentIF-OneDay 发布,评估全场景长时复杂任务

红杉中国 xbench 发布 AgentIF - OneDay 评测体系,用于评估大模型解决复杂任务的能力。该体系从任务复杂度新视角出发,沿 Scaling Context 和 Scaling Domain 推进,构造了三类典型任务进行测评,揭示了主流 Agent 的能力边界。

特工宇宙
产品应用7

Claude版Manus宕机,全网炸锅!顶级开发者曝光致命缺陷

Claude Cowork开年爆红,引发大量关注和讨论,两天内浏览量达五千万,甚至因太火爆致Claude用量太大而宕机。Django之父Simon Willison揭露其核心机制,也指出存在提示词攻击风险。

新智元
开源动态8

MiniMax 上市后的第一个开源:给 Coding Agent 立个规矩

2026 年初 MiniMax 成功上市港股,市值达 1100 亿港币。其上市后首个开源项目 OctoCodingBench 聚焦 Coding Agent 评估,解决规则复杂时 Agent 合规问题,为其立规矩,有重要社区价值。

MacTalk
推荐文章8

一文搞懂 Agents 评测丨Anthropic 最新万字长文

传统模型评测方法难评估 Agent 系统,Anthropic 摸索出有效评测设计方法。文章介绍评测结构、意义、方法,涵盖编程、对话等 Agent 评测,还给出打造评测路线图及与其他方法结合的建议。

特工宇宙
产品应用8

让两个大模型「在线吵架」,他们跑通了全网95%科研代码|深势发布Deploy-Master

科学计算领域开源软件多,但多数无法直接运行,制约可用性。Deploy - Master 针对此开发,通过搜索筛选工具、双模型博弈构建,将部署成功率提至 95%以上,为 Agentic Science 提供行动基座。

机器之心
新闻资讯7

蚂蚁阿福对打ChatGPT Health,哪家强?

全球科技大厂在健康赛道竞争激烈,OpenAI推出ChatGPT Health,与蚂蚁阿福功能相似。对比发现,阿福在功能精细度、打通专业医疗服务上领先,二者都引入专家团提升专业性。

AI科技评论
新闻资讯8

2025年末全球 AI 行业流量报告:狂热退潮,分化开始

Similarweb报告显示,2025年Q4 ChatGPT流量同比跌22%。各AI产品走势分化,如Gemini涨49%,Claude坐“过山车”。AI编程、写作等领域也有不同表现,还揭示对传统行业冲击没那么快。

宝玉AI