核心判断
AirLLM(仓库 lyogavin/airllm)解决的是一个被多数推理库放弃的问题:在 4-8GB 显存的消费级硬件上,跑起 70B 甚至 405B、671B 参数的原始权重模型。它走的是"分时换入"这条路——平时只把当前正在计算的那一层参数读进显存,其余层在 NVMe/SSD 上待机,算完即弃,下一层顶上。 AirLLM(仓库 lyogavin/airllm)解决的是一个被多数推理库放弃的问题:在 4-8GB 显存的消费级硬件上,跑起 70B 甚至 405B、671B 参数的原始权重模型。它走的是"分时换入"这条路——平时只把当前正在计算的那一层参数读进显存,其余层在 NVMe/SSD 上待机,算完即弃,下一层顶上。