Просмотр проектов — llama.cpp TurboQuant
llama.cpp TurboQuant
2026
- c++
- cuda
- metal
- vulkan
- cmake
- llm
Форк llama.cpp со своими форматами квантизации TQ2/TQ3/TQ4 и ядрами под CUDA, Metal и Vulkan. Около 14 800 строк собственного кода плюс свой CI релизных сборок. Профилирую инференс там, где он упирается в железо, а не в код.
Картинок пока нет