News brief
正文
今日,深度求索正式发布最新一代MoE架构大模型DeepSeek-V3。该模型总参数量达671B,激活参数仅为37B,在MMLU、HumanEval等核心评测集上超越GPT-4o。得益于自研的无辅助损失负载均衡策略,DeepSeek-V3的训练成本仅消耗278.8万H800 GPU小时,推理成本更是降至行业同级别模型的十分之一,再次打破大模型算力成本壁垒,推动AI应用普惠化。
News brief
今日,深度求索正式发布最新一代MoE架构大模型DeepSeek-V3。该模型总参数量达671B,激活参数仅为37B,在MMLU、HumanEval等核心评测集上超越GPT-4o。得益于自研的无辅助损失负载均衡策略,DeepSeek-V3的训练成本仅消耗278.8万H800 GPU小时,推理成本更是降至行业同级别模型的十分之一,再次打破大模型算力成本壁垒,推动AI应用普惠化。