「大模型幻觉」共找到 9212 篇相关文章
如何让AI帮你做前端自动化测试?我们这样落地了
本文介绍阿里基于AI的UI自动化测试框架在专有云质量保障的实践。框架用开源browser - use等工具,采用自然语言驱动用例、动态元素定位等机制,还应对了大模型幻觉等挑战,也提及构建企业级数据分析Agent方案。
AI编程冲刺“DeepSeek时刻”:00后团队用国产模型一键直出复杂应用,效果超越Claude Code
云端Agent有新进展,重新定义AI编程范式。Vinsoo上新Beta 3.0版本,仅用国产大模型就超越一众流行AI编程产品。它解决了4个核心技术问题,还带来三重云端AI Agent新体验,其研发团队由00后主导。
开源模型终于有了自己的 Opus 时刻
智谱深夜发布的新一代旗舰模型 GLM - 5,此前以匿名模型 Pony Alpha 被开发者热测。2026 年编程大模型风向转变,GLM - 5 参数提升,测试成绩优异,实测能完成复杂工程任务,适配国产算力平台。
神秘霸榜模型现真身:小米MiMo-V2 Pro,国内首个万亿参数+1M上下文,为Agent而生!
小米全新一代面向 Agent 的大模型家族官宣,包括 MiMo-V2-Pro Preview、MiMo-V2-Omni 和 MiMo-V2-TTS。MiMo-V2-Pro 性能优异,在多场景实测表现出色,技术有创新,API 开放且定价低,已融入小米多业务与生态。
Claude 小升级就赢了OpenAI 9年“开源神作”?高强度推理直接歇菜、幻觉率高达50%,写作还被Kimi 2吊锤?
OpenAI发布首个开源语言模型系列gpt - oss,包括gpt - oss - 120b和gpt - oss - 20b,可在Hugging Face下载。同期谷歌Deepmind推Genie 3,Anthropic放出Claude Opus 4.1。Claude Opus 4.1编程性能提升,实测编码能力强于gpt - oss。gpt - oss虽有亮点,但幻觉率高、实测效果不佳。
AI翻译的「最后一公里」
文章指出文化差异成AI翻译难题,通用大模型数据不平衡,存在“算法霸权”。如处理低资源语言,AI易产生幻觉,还因无肉身难理解基于生理体验的隐喻,人机协作才是翻译未来。
“中国AI变强,对全球安全反而是一件好事!” DeepMind传记作者:神秘模型Mythos被紧急下架,OpenAI的同款武器却被放了一马
DeepMind传记作者塞巴斯蒂安·马拉比认为,硅谷“谁先造出AGI谁通吃全球”是幻觉,AI虽实际裁员不多,但恐慌感会放大。还指出OpenAI财务窟窿大,中美AI实力均衡利于全球安全,美国政府监管混乱。
北大发布学术搜索评测ScholarSearch:难倒一众DeepResearch的“开卷考试”
北京大学DS - Lab发布ScholarSearch,这是评估大语言模型学术检索能力的数据集,含223道高难度题目。评估显示现有模型表现欠佳,纯推理模型准确率低,有搜索功能的模型虽有提升但仍不足。
马斯克掀桌子了,最强开源大模型诞生!Grok-2近万亿参数性能首曝
xAI官宣向所有人开源Grok - 2,其有9050亿参数、128k上下文窗口等强大技术规格。还梳理了开源部分、技术特点、权限等,介绍使用方法,网友和大佬高度评价,马斯克预告后续计划。
一周10来个模型被开源,阿里Qwen杀疯了~
阿里通义千问这周开源众多模型,如Qwen3 - Omni、Qwen - Image - Edit等,涉及全模态、图像编辑、安全审核等多领域。各模型能力出色,如Qwen3 - Omni能处理多模态输入,Qwen3 - VL表现超部分闭源模型。