「通用认知能力」共找到 3930 篇相关文章
刚刚,DeepMind通用科学智能体AlphaEvolve突破数学极限,陶哲轩合作参与
DeepMind发布革命性进化编码智能体AlphaEvolve,由LLMs驱动,可演化代码库、发现和优化算法。它结合LLM创造力与自动化评估,减少幻觉,在多领域应用前景大,还与陶哲轩合作探索数学应用。
Qwen 3-235B Aider编程能力击败Claude3.7,成本便宜百倍
Qwen3-235B-A22B在Aider多语言编码基准初步测试中击败Sonnet 3.7 Thinking和OpenAI o1,成本便宜150到600倍。Qwen3-32B准确率超GPT-4.5和GPT-4o ,代码编辑格式正确率达100%。
AI 能力越来越强,那么它生成的代码,人类还需要去理解吗?
《代码整洁之道》作者罗伯特·C·马丁不逐行看 Agent 代码,设好测试框架通过就行。Notion 工程师 Geoffrey Litt 在会议探讨人类是否需理解代码,多数人认为需要,Litt 分享理解代码方法。
兼顾效率、成本与能力,百灵开源旗舰推理模型 Ring-2.6-1T
5月15日,蚂蚁百灵开源旗舰级推理模型Ring-2.6-1T,权重文件上线Hugging Face、ModelScope平台。该模型有万亿参数,‘按需思考’,在代理执行、推理机制、训练范式三方面升级,评测表现出色。
这家公司刚成立7个月,正在打磨通用具身智能的终极形态
超维动力(Kinetix AI)于2025年7月注册,9月研发,不足一年便举办独特发布会,让KAI人形机器人“自己发布自己”。其认为高拟人是训练强世界模型前提,构建了含本体、世界模型等的技术体系,但面临工程与成本挑战。
刚刚,阿里旗舰模型Qwen3-Max-Thinking发布,编程能力“踢馆”Gemini与Claude
阿里发布旗舰模型Qwen3-Max-Thinking,总参数超1万亿,在多项权威基准测试中表现优异,可与顶级闭源模型竞争。千问团队为其引入两项核心创新,提升推理性能,该模型已可免费体验。
啊?微博7800美元训的大模型,数学能力超了DeepSeek-R1
近日,微博发布自研开源大模型VibeThinker,15亿参数却在数学测试上击败6710亿参数的DeepSeek R1,后训练成本仅7800美元。其为AI产业带来新思考,还将推动微博AI应用发展。
超越RAG,DRAG让LLM准确率飙升45.5%,问题越复杂能力越强
RAG技术虽能让LLM检索资料生成答案,但存在短板,听不懂话里有话。DRAG方法应运而生,有DRA和RSC两大法宝,经对比实验,它在多任务上领先,准确率大幅提升,计算开销小。
EMNLP2025 | 探究大语言模型的语言共享神经元提升低资源语言能力
论文提出BridgeX - ICL方法提升LLM低资源语言性能,通过三步实现优化。构建两类探测数据解决传统问题,识别重叠神经元,用HSIC选最优桥梁语言,在多任务实验验证其有效,揭示多语言机制规律。
大模型训练新突破!Meta提出LSP:无数据也能实现能力飞升
Meta提出语言自我博弈(LSP)方法,利用自我博弈框架让模型自我改进,不依赖额外数据。LSP赋予模型挑战者和解题者身份,引入GRPO和KL散度正则化技术,解决了大模型训练的数据依赖难题。