错误分析」共找到 1221 篇相关文章

开源动态8

o3绞尽脑汁仅答对40%的题目,开源模型基本乱猜?MMSI-Bench:多图空间智能试金石

文章介绍了MMSI - Bench,这是用于评估MLLM多图像空间推理能力的VQA基准。它人工构建样本、全面分类任务、采用多样真实数据。实验显示MLLM在多图像空间推理有短板,还开发自动化错误分析流程助力改进。

量子位
算法论文8

LLM 驱动的 AI Agent通信:协议、安全风险与防御对策

论文围绕智能体通信的协议、安全风险及防御对策展开探讨。介绍兴起与重要性、定义分类、解析多种协议,分析不同交互的安全风险,提出防御对策,还以MCP和A2A为例做攻击实验,给出未来研究方向。

PaperAgent
推荐文章7

万字实录:AI究竟是普通人的“印钞机”,还是更狠的「收割机」?| GAIR Live 021

雷峰网&AI科技评论邀三位老师探讨“AI大模型金融应用的机遇与挑战”。以Trading Arena大赛为例,分析大模型在金融投资应用,指出打造强逻辑推理“大脑”是金融应用关键,也提及Agent局限与“黑天鹅”预判路径等。

AI科技评论
开源动态8

本周推荐的6个yyds的Github开源项目!

文章推荐6个GitHub开源项目。如Stretchly是休息提醒工具,助打工人养成科学节奏;Yaak是API客户端,主打离线隐私;ValueCell用于金融AI分析交易;nof1 - tracker可跟单交易;Zerox转换文档为Markdown;Open Notebook是Google Notebook LM平替。

开源先锋
新闻资讯7

DeepMind AlphaProof 前负责人谈2025年IMO

前Google DeepMind AlphaProof项目联合负责人Rishi Mehta发布关于2025年IMO结果的分析。今年OpenAI和Google DeepMind双双宣布达到金牌水平,解法各有特点。Mehta预测前沿大语言模型明年或开箱即用获奖牌,未来6个月内或攻克非平凡开放数学问题。

AGI Hunt
产品应用7

Hexstrike AI的安装及交互跟踪环境

Hexstrike AI是基于专业化Agent协同的智能渗透测试系统,有强大自动化攻击能力。文章介绍其安装方法,包括服务端和客户端配置,还提及搭建跟踪系统及后续计划,将深入分析专业AI代理原理及关注v7.0新功能。

AI与安全
7

2027年实现AGI?计算物理学家怒怼:纯属无稽之谈!

知名博主Scott Alexander领衔的项目称AI将在2027年达超人智能。但计算物理学家经研究指出,该预测模型漏洞百出,如数学错误、曲线选择无依据、图表与模型不符等,即便新模型改进部分问题,多数批判仍成立。

AGI Hunt
新闻资讯7

Auto Research时代,AI Scientist的第一场药企实习考验|甲子光年

AI Scientist从大模型做题家进化为自动化科研助手,但从demo到应用面临买单难题。Phylo等团队构建BiomniBench评估框架,让AI做药企真实数据分析,结果显示AI表现超人类实习生,且有速度和成本优势,但也存在偏科问题。

甲子光年
开源动态7

从社区数据出发,再看大模型开源开发生态全景与趋势

蚂蚁开源先后在527蚂蚁技术日和外滩大会发布大模型开发生态开源项目全景图1.0和2.0版本。2.0版更新评估方法,呈现生态新变化,还分析技术趋势、开发者分布,提及项目进出情况及TensorFlow衰落等。

InfoQ
新闻资讯7

Ben Thompson:Agent会下单之后,Amazon 和 Shopify 活得更好了

大家以为AI会重构电商,可ChatGPT的checkout功能未成功,Shopify、Amazon等电商平台仍活得好。分析师Michael Morton指出,AI改变产品发现入口,但难抹平支付等环节,品牌官网因AI获更多流量。

Founder Park