「大模型Agentic推理框架」共找到 9822 篇相关文章
刚刚,Anthropic王炸Claude泄露!全面碾压Opus 4.6引爆全网
因「人为配置」错误,Anthropic最强模型Claude Mythos细节泄露。它编程、推理能力超Claude Opus 4.6,还具备网络攻防能力,但也带来安全风险,Anthropic因担心被黑客利用暂未发布。
别再让语音机器人“答非所问”:AI Force任务型语音对话技术总结
本文围绕企业级任务型语音Agent核心挑战,提出解决“拟人化”与“专业化”问题。介绍三段式语音对话解法、架构演进,还提及‘衍算’推理框架等技术及未来方向,团队来自蚂蚁集团AI force。
Karpathy刚进Anthropic,转头又投了它
AI初创公司Engram成立8个月,估值达6亿美金,获9800万美元融资。它聚焦AI记忆,用Cartridges技术降内存、提速度,将推理和记忆层拆开,团队成员背景强大,押注AI范式新转向。
OpenAI深夜祭出GPT-5.4,暴击Claude!原生操控电脑,打工人悬了
OpenAI发布GPT - 5.4,全面反击Gemini 3.1 Pro和Claude Opus 4.6。它是首个有「原生电脑使用」能力的通用模型,各维度无短板,成绩炸裂,定价也创新高。
数学圈地震!o3靠直觉刷爆人类顶尖难题,14位专家集体破防
Epoch AI新研究发现,o3 - mini - high能破解顶尖数学难题,具备渊博学识且会基于直觉解题,但推理风格依赖直觉,缺乏严谨性和创造力,还存在投机取巧、幻觉等问题。
Spec 退场,skills 上位:Codex 团队的产品方法论变了
文章介绍了OpenAI Codex团队产品方法论的变化,从重视spec转向skills,开发从“描述过程”转向“组织能力”。还谈及Codex app开发、团队协作等,指出模型变强后工作模式转变,职业边界模糊,团队招人看重主动性。
鹏城实验室 X 中大hcp实验室推出 RADAR : 具身智能评测的新标杆
RADAR是鹏城实验室与中大hcp实验室为具身智能领域设计的评测基准,解决现有评测体系三大缺陷,通过创新设计揭示模型不足,为研究者提供方向,推动具身智能实用化。
清华刘知远团队论文:最小化结构改动,短文本到长文本丝滑升级 | ICLR 2026
大语言模型发展中,上下文长度成关键瓶颈,主流架构计算开销大。清华刘知远团队提出《InfLLM-V2: Dense-Sparse Switchable Attention for Seamless Short-to-Long Adaptation》,提出可切换注意力框架,为长上下文研究提供新思路。
直接免单!阿里千问30亿请客吃喝玩乐,春节AI大战彻底白热化
阿里千问APP官宣砸30亿开启「春节请客计划」,2月6日起以「免单」请全国人民吃喝玩乐,阿里生态「全家桶」加入。千问已接入阿里生态,借补贴加速AI Agent普及,有望凭「免单+服务」成「生活万事通」。
《时代》2025重塑世界的五大AI进展
本文讲述2025年AI重大进展。中国Deepseek R1开源模型冲击全球格局,AI具备思考能力,特朗普政府推“星际之门计划”,AI公司支出逼近1万亿美元,同时AI与人类关系更复杂,引发风险思考。