github.com
feat(provider): attached OpenAI-compatible engines (mei, llama-server, mlx_lm) + per-model admission gate by DGaffney · Pull Request #237 · graze-social/cocore
Why
@tijs measured vllm-mlx at 4–5× slower than llama.cpp on his M1 Max, stopped serving real models (Sulaco is registered serving only stub), and built mei — a native Swift/MLX server that closes ...