「推理模型瓶颈」共找到 8503 篇相关文章
史上最惨一代?AI延长人类寿命,下一代活到200岁不是梦!
内容创业者Matt Wolfe长期关注AI,他与工程师交流,揭示AI发展现状。巨头各有策略,能源或成瓶颈。AI或带来智能爆炸与生命延长,也可能有‘黑箱语言’风险,还探讨了寿命、机器人等影响。
“别再碰我代码!”明星AI工具成瘟神,用户怒斥:一周七千块,修不好bug还删我关键文件!
AI编程服务提供商Replit推出新一代AI编程助手Agent 3,CEO称其为软件“自动驾驶时刻”。但用户反馈它修不好bug还删关键文件,成本也高,Replit回应强调“模型栖息地”和“事务性”机制重要性。
AI胡说八道这事,终于有人管了?
AI大模型幻觉问题棘手,GPT - 5幻觉率降低。苏黎世联邦理工学院和MATS研究提出低成本、可扩展检测法,精准识别实体级幻觉,分类器超现有基准,还能识别逻辑错误,团队已公开数据集。
Claude Opus 4.1 上线,SWE-bench 验证率 74.5%,重构可靠性与安全性全面升级
Anthropic推出Claude Opus 4.1,是Opus 4重要升级版。SWE - bench验证率从72.5%提至74.5%,多文件代码重构可靠性及长链交互推理能力增强,无害响应率提升,合作率下降,定价不变。
Claude Code之父最新访谈揭秘:Claude Code 迭代靠的是直觉「附个人独家使用秘笈」
Claude Code项目负责人Boris Cherny在访谈中揭秘其迭代靠‘直觉系统’,探讨智能体编程实用化、模型演进等。他还谈及软件工程师未来工作转变,给出使用Claude Code秘笈,强调基础与创造力重要性。
迈向可信AI:LLM幻觉的分析与优化
随着LLM广泛应用,其幻觉现象成AI落地关键挑战。文章分析LLM幻觉成因、优缺点,结合RAG、SFT、强化学习等技术,提出多维度优化方案,为构建可信大模型应用提供理论与实践路径。
12.4K 标星!开源AI编程神器 Dyad,v0、Bolt的开源平替!
AI 编程领域的 v0、Lovable、Bolt 等平台虽降低开发门槛,但有联网、隐私等问题。开源项目 Dyad 可作其替代方案,支持本地运行、多模型,能与 IDE 等集成,已获 12.4K 标星。
GPT-5 放弃追求智能上限了?
GPT-5发布,虽借OpenAI名气获流量,但AI科技评论认为其结果令人失望。它推销转向任务性能提升,非基础大模型能力突破。虽成果出色,但也引发对AGI发展的反思,还面临诸多难题。
GPT-5真的拉胯吗?机器之心一手实测,网友:还我4o、还我4.5
OpenAI发布GPT - 5后评价褒贬不一。有人认为它进步大,也有人差评,如制作游戏、重构代码失败。机器之心实测发现其表现不稳定,写作、推理、编码能力有好有坏,复杂任务表现欠佳。
Kimi K2技术报告正式发布:“保姆级”深度解析,一文读懂万亿参数智能体的所有秘密
Kimi K2技术报告发布,Moonshot团队用万亿+参数稀疏MoE架构等打造接近Claude - Opus的通用大模型。围绕训练稳定性等改进,有预训练、架构设计等多方面创新,为智能体领域提供可行路径。