「非编码任务」共找到 2799 篇相关文章
医疗AI迎来大考!南洋理工发布首个LLM电子病历处理评测 | AAAI'26
南洋理工大学研究人员构建EHRStruct基准,涵盖11项核心任务、2200个样本,用于评测LLM处理结构化电子病历的能力。研究发现通用大模型优于医学专用模型,提出的EHRMaster框架与Gemini联合后性能超现有模型。
让AI学会潜意识推理,Sapient发布类脑模型HRM
新加坡初创公司Sapient Intelligence发布仅2700万参数的分层推理模型HRM,在多项高难度推理任务上超越大模型。它绕过大模型推理困境,借鉴大脑机制,训练效率高,开源后GitHub星标突破10.3k。
亿点点新融资砸向具身智能:斯坦福华人团队,首创“自适应机器人”品类
具身智能火热,非夕科技完成C轮亿级美元融资,由咏归基金、广发信德联合领投。该公司由斯坦福大学相关成员创立,首创“自适应机器人”品类,此轮资金用于扩产、研发及生态拓展。
代码智能体占领GitHub!自动修bug、加功能、写文档,一台手机就能指挥
GitHub上新代码智能体Copilot Coding Agent,可自动修bug、加功能、写文档,开发者评价很棒。在手机APP就能操作,还能同时分配多任务。微软宣布VSCode中GitHub Copilot将开源,还发布多项新功能。
二元成功率已经过时!PRM-as-a-Judge才是你需要的具身操作评测框架
传统二元成功率评测具身操作任务有局限,难回答策略推进、执行效率等问题。中科院自动化所等机构研究人员提出PRM - as - Judge框架,含进度势能、OPD指标体系和RoboPulse基准,能细粒度审计执行过程。
腾讯纯文本LLM训视觉encoder,拿捏图表长视频,达到开源小模型SOTA!
腾讯开源Penguin - VL,直接用纯文本LLM训视觉编码器,跳出传统多模态拼接套路。在2B/8B紧凑参数规模的复杂任务中竞争力强,训练分三阶段,相关代码、模型等已开放。
Karpathy最新发文:醒醒!别把AI当人看,它没欲望也不怕死
Andrej Karpathy在推文中反驳将大模型视作「更聪明人类」的观点,指出大模型是「非生物」智能,其进化压力、学习机制、运行方式与人类不同。清楚这是全新智能,对理解大模型很重要。
Anthropic这两天真没闲着:上线网页版Claude Code,还让Claude搞科研
Anthropic推出Claude Code网页版,无需本地安装命令行工具,还提供Claude iOS应用预览版。其有并行处理多任务等亮点。此外,还发布Claude生命科学版,搭载Claude Sonnet 4.5模型,能助力科研。
吴恩达:AI编程加速开发也埋下大坑,软件测试空前重要
吴恩达认为AI编程虽加速开发,但Agentic编码系统不可靠,会引入漏洞、删除代码等。他给出核心解法,利用Agentic测试,优先测后端和底层架构,还明确测试优先级,前端低、后端高。
AI的新技能不是提示词,而是上下文工程
最近,“上下文工程”在AI领域备受关注,人们讨论焦点正从“提示词工程”转移至此。构建有效AI智能体的秘诀在于提供的上下文质量,而非代码复杂程度,这正是上下文工程的意义。