lightseekorg/tokenspeed
TokenSpeed is a speed-of-light LLM inference engine.
Language: Python
#blackwell #deepseek #gpt_oss #kimi #lightseek #llm #minimax #qwen #speed_of_light #tokenspeed
Stars: 695 Issues: 15 Forks: 43
https://github.com/lightseekorg/tokenspeed
TokenSpeed is a speed-of-light LLM inference engine.
Language: Python
#blackwell #deepseek #gpt_oss #kimi #lightseek #llm #minimax #qwen #speed_of_light #tokenspeed
Stars: 695 Issues: 15 Forks: 43
https://github.com/lightseekorg/tokenspeed
GitHub
GitHub - lightseekorg/tokenspeed: TokenSpeed is a speed-of-light LLM inference engine.
TokenSpeed is a speed-of-light LLM inference engine. - lightseekorg/tokenspeed
❤2👍1
gavamedia/deltafin
Run full Kimi K3 on a single device. And an OpenAI-compatible API server for local chat and coding agents.
Language: Python
#kimi #kimi_k3 #local_ai #local_llm
Stars: 497 Issues: 4 Forks: 54
https://github.com/gavamedia/deltafin
Run full Kimi K3 on a single device. And an OpenAI-compatible API server for local chat and coding agents.
Language: Python
#kimi #kimi_k3 #local_ai #local_llm
Stars: 497 Issues: 4 Forks: 54
https://github.com/gavamedia/deltafin
GitHub
GitHub - gavamedia/deltafin: Run full Kimi K3 on a single device. And an OpenAI-compatible API server for local chat and coding…
Run full Kimi K3 on a single device. And an OpenAI-compatible API server for local chat and coding agents. - gavamedia/deltafin
❤2👍1
FareedKhan-dev/kimi-k3-in-c
A 2.78-trillion-parameter Kimi K3 running inference on a single CPU in 8.24 GB of RAM. Portable C99: no BLAS, no framework, no GPU.
Language: C
#avx2 #c99 #cpu_inference #deep_learning #from_scratch #inference_engine #kimi_k3 #linear_attention #llm #llm_inference #machine_learning #memory_efficient #mixture_of_experts #moe #mxfp4 #quantization #simd #systems_programming #transformer #zero_dependencies
Stars: 1398 Issues: 5 Forks: 220
https://github.com/FareedKhan-dev/kimi-k3-in-c
A 2.78-trillion-parameter Kimi K3 running inference on a single CPU in 8.24 GB of RAM. Portable C99: no BLAS, no framework, no GPU.
Language: C
#avx2 #c99 #cpu_inference #deep_learning #from_scratch #inference_engine #kimi_k3 #linear_attention #llm #llm_inference #machine_learning #memory_efficient #mixture_of_experts #moe #mxfp4 #quantization #simd #systems_programming #transformer #zero_dependencies
Stars: 1398 Issues: 5 Forks: 220
https://github.com/FareedKhan-dev/kimi-k3-in-c
GitHub
GitHub - FareedKhan-dev/kimi-k3-in-c: A 2.78-trillion-parameter Kimi K3 running inference on a single CPU in 8.24 GB of RAM. Portable…
A 2.78-trillion-parameter Kimi K3 running inference on a single CPU in 8.24 GB of RAM. Portable C99: no BLAS, no framework, no GPU. - FareedKhan-dev/kimi-k3-in-c