NVIDIA Groq 3 LPX如何在Vera Rubin平台实现超快长上下文推理
NVIDIA Groq 3 LPX是专为Vera Rubin平台设计的交互式AI推理加速器。第三方机构Artificial Analysis在Gemma 4 31B模型上完成首次基准测试,于100K上下文长度下实测输出速...
NVIDIA Groq 3 LPX是专为Vera Rubin平台设计的交互式AI推理加速器。第三方机构Artificial Analysis在Gemma 4 31B模型上完成首次基准测试,于100K上下文长度下实测输出速...
本文介绍AdaptGrow算法——一种GPU加速的对称非负矩阵分解(SymNMF)方法,可将滚动相关矩阵和尾部依赖矩阵转化为硬聚类标签、软因子载荷及结构突变信号。通过内存优化将峰值存储从约20n?降至4n?字节,单块NV...
本周企业技术领域聚焦AI基础设施建设的现实挑战。英伟达为OpenAI俄亥俄州数据中心提供最高1050亿美元担保,显示芯片厂商正深度介入数据中心融资。宾夕法尼亚州出台新法规,要求超25兆瓦数据中心满足电力供给要求。Anth...
NVIDIA研究项目AVO(智能体变异算子)在ARC-AGI-3公开集全部25个环境中获得100分满分,完成183个关卡,所用环境动作数比VISTA系统少约12%。AVO的核心优势在于持久记忆、监督机制和长期自主运行能力...
随着AI智能体能力增强、任务周期延长,安全设计愈发关键。NVIDIA安全团队结合OpenShell等项目,梳理了智能体技术栈的核心层次:模型层、编排层、元编排层、安全运行时及推理基础设施。文章指出,提示词与模型护栏只能引...
英伟达推出recsys-examples与nv-embedding-cache,推动推荐系统从传统嵌入相似度方法转向生成式架构。文章介绍了HSTU和语义ID两种生成式推荐方案,解析DynamicEmb动态嵌入表、分层KV...
NVIDIA Holoscan是面向边缘端实时AI应用的开发平台,涵盖医学影像与机器人等领域。本文介绍如何借助AI编码智能体构建实时内窥镜工具分割应用,通过HoloHub示例、开发文档与Holoscan CLI协同驱动开...
NVIDIA发布Cosmos 3 Edge,这是一款4B参数的全模态模型,专为机器人端侧部署设计,可在NVIDIA Jetson Thor上本地运行推理。该模型基于与Cosmos 3 Nano和Super相同的物理世界数...
NVIDIA推出开源工具SkillEvaluator,用于评估技能包对AI智能体性能的影响。该工具通过三级评估体系(静态检查、差异性检测、实时运行对比)对300余项已验证技能进行基准测试。结果显示,安装技能后,智能体在正...
NVIDIA cuML与cuVS 25.06版本推出多GPU支持的UMAP训练功能,通过将计算密集的全邻居kNN图构建任务分布至多块GPU,显著提升大规模数据集的处理效率。该方案将数据集划分为均衡集群,各GPU独立计算局...
NVIDIA通过量化感知蒸馏(QAD)技术,将Nemotron 3.5 Lightning模型从66GB压缩至22GB的NVFP4格式,在保持精度的同时实现最高4倍吞吐量提升。QAD以全精度BF16模型为教师,通过KL散...
印度尼西亚通信与数字事务部、Indosat、NVIDIA与加贾马达大学(UGM)联合在日惹启动UGM Indosat NVIDIA AI技术中心,这是印尼首个以大学为基础的AI技术中心。该中心依托NVIDIA全栈AI平台...
阿里巴巴发布了开源旗舰模型Qwen3.8-2.4T-A95B,总参数量达2.4万亿,每次推理激活参数约950亿。该模型采用细粒度MoE架构与全注意力/线性注意力混合机制,支持最长100万token上下文。在NVIDIA ...
NVIDIA发布Nemotron 3.5 Lightning,这是一款300亿参数的混合专家模型,专为长时运行的智能体AI工作负载设计,输出速度提升4倍,任务完成速度提升30%。同步推出的开源库NeMo Switchya...
NVIDIA NeMo Switchyard 是一个开源模型路由框架,可在多个AI模型间智能分配Agent任务。它通过分析请求特征、模型能力和系统状态,将每个任务路由至最合适的模型,在保证质量的同时降低成本和延迟。框架提...
NVIDIA JetPack 7.2.1为Jetson平台带来多项重要更新:首次支持PyNvVideoCodec 2.2 Python硬件加速视频编解码库,提供GPU显存帧处理、多模式采样及后台预解码等AI流水线友好特性...
NVIDIA发布开源混合专家模型Nemotron 3.5 Lightning,拥有300亿总参数、30亿活跃参数,专为自主智能体的高频执行层设计。该模型支持推测解码、多令牌预测及NVFP4量化,在同类模型中实现最高4倍输...
NVIDIA发布Cosmos 3开放物理AI基础模型,采用混合Transformer架构,集视觉推理、世界生成与动作预测于一体。模型家族涵盖64B的Super、16B的Nano和4B的Edge三个版本,可在边缘GPU上部...
NVIDIA发布Alpamayo 2 Super,这是一款340亿参数的开源推理视觉语言动作模型,专为加速自动驾驶开发设计。该模型集成轨迹生成、因果链推理、元动作预测、视觉问答和自动标注五大能力,支持七路摄像头360度感...