LLM in a flash: Efficient Large Language Model Inference with Limited Memory
Keivan Alizadeh, Iman Mirzadeh, Dmitry Belenko +5 authors
Efficient inference for large language models on devices with limited DRAM by optimizing data transfer and access from flash memory.