SigmanticAI/apex-inference-chip
An inference chip design that runs a real LLM (Qwen2.5-0.5B) on FPGA — one transformer decoder layer in RTL, every silicon value bit-exact against a golden model. 0.56 tok/s measured, a 140× climb, full evidence trail.
Language: Python
Stars: 647 Issues: 0 Forks: 1
https://github.com/SigmanticAI/apex-inference-chip
An inference chip design that runs a real LLM (Qwen2.5-0.5B) on FPGA — one transformer decoder layer in RTL, every silicon value bit-exact against a golden model. 0.56 tok/s measured, a 140× climb, full evidence trail.
Language: Python
Stars: 647 Issues: 0 Forks: 1
https://github.com/SigmanticAI/apex-inference-chip
GitHub
GitHub - SigmanticAI/apex-inference-chip: An inference chip design that runs a real LLM (Qwen2.5-0.5B) on FPGA — one transformer…
An inference chip design that runs a real LLM (Qwen2.5-0.5B) on FPGA — one transformer decoder layer in RTL, every silicon value bit-exact against a golden model. 80× measured speedup, full evidenc...