差评」共找到 374 篇相关文章

算法论文8

Google | 溯源分析RAG系统错误,提出选择性生成框架,让RAG问答准确率提升10%

Google对RAG系统错误深入分析,引入‘充分上下文’概念,指出幻觉或因上下文不足。构建估器,提出选择性生成框架,结合多信号决策,实验显示可让RAG问答准确率最高提升10%。

AINLPer
产品应用7

Raycast + MCP = AI Mac

Raycast添加AI插件可实现跨应用调度,现支持MCP。它解决了MCP用户部署、配置难的问题,提供接近自动部署的方法。还介绍了MCP在Raycast中的安装与使用,以及作者常用的支持MCP的客户端。

newtype AI
7

刚刚,DeepSeek V4 Pro正式版发布,多项对标Fable 5

刚刚,DeepSeek V4 Pro正式版发布,多项对标Fable 5,Agent能力几乎全方位碾压Opus 4.8,无限逼近Fable 5。API平台已更新,价格和之前Pro预览版基本一致,但网友实测发现CoT表现不佳。

量子位
算法论文7

苹果新论文发出惊人一问:What do your logits know?

苹果AI研究团队提交论文《你的logits知道些什么?(答案可能会让你惊讶!)》,触及大模型底层逻辑及苹果看重的用户隐私与数据安全。研究通过实验揭示模型信息留存状态,指出存在隐私泄露隐患。

机器之心
新闻资讯7

Claude封号潮失控!300 万用户企业一夜断供,无理由、无回应,受害者被迫抱团反抗

Claude 出现封号潮,Belo App CTO 等众多用户被封却无解释,申诉只能填 Google 表单。用户不满累积,上线“Banned by Anthropic”网站呼吁改进封禁与申诉流程,还引发“单一厂商锁定”讨论。

AI前线
新闻资讯8

美国ATOM报告:Qwen称霸武林,中国统治开源世界

美国ATOM报告显示,2025年夏中国开源语言模型超美国,下载、使用量距显著。Qwen成王者,DeepSeek在大模型领域表现出色。新势力如Nvidia、OpenAI等也在追赶,报告引入新指标衡量模型热度。

AIGC开放社区
开源动态8

我们对 Coding Agent 的测,可能搞错了方向

用户对 Agent 不满常因它「做得不好」,不遵循指令和规范。当前主流测体系以结果为导向,与真实场景错位。MiniMax 开源 OctoCodingBench 测集,结果显示模型过程规范遵循不足,未来训练需引入过程监督。

Founder Park
8

刚刚,DeepSeek扔出大杀器,梁文锋署名!暴力优化AI架构

2026新年第一天,DeepSeek发表梁文锋署名新论文,提出「mHC(流形约束超连接)」架构。它仅增约6.7%训练时间开销,就能让27B参数模型性能显著提升,还可能淘汰ResNet结构。

力学与人工智能
新闻资讯8

Karpathy新思考:别把AI当动物,它们是全新的智能物种

Andrej Karpathy发长推提出颠覆性观点,认为人们用错误框架理解AI,对比了动物智能与LLM智能的优化动力、根本异等,强调优化目标决定智能形态,指出应按其机制对待AI。

AI工程化
新闻资讯7

ICLR 2026出分,审稿员怒喷「精神病」!DeepMind研究员教你绝地求生

ICLR 2026审结果公布,投稿量近2万篇创新高,但分数滑坡,平均分从5.12跌至4.2。审稿人吐槽质量低,甚至有怒喷‘精神病’的情况。DeepMind研究员提供论文反驳指南,称同行审像‘随机数生成器’。

新智元