Local AI, 17 Aug – 23 Aug 2026

34 posts · All weeks

Sunday, 23 August 2026

Google's leaked COSMO doc shows Gemini Nano on‑device AI skills, while llama.cpp adds CUDA pooling support.

Saturday, 22 August 2026

Liquid AI's DSpark‑optimized LFM2.5 models hit 2.67× speedup, now supported in llama.cpp b10581.

Friday, 21 August 2026

Liquid AI's LFM2.5-DSpark speculative decoding boosts local LLM speed 3.18× without output changes.

Thursday, 20 August 2026

Gemma 4 now runs LLM inference on laptops, while Ollama 0.32.15 adds metadata caching for faster desktop AI

Wednesday, 19 August 2026

AMD’s ZenDNN boosts llama.cpp prompt speed 4.5× on EPYC, while vLLM now runs on ROCm‑enabled Radeon 6000 GPUs.

Tuesday, 18 August 2026

AMD’s Radeon AI PRO R9700 now runs Qwen3.8‑27B at 51.8 tokens/sec, boosting local LLM inference.

Monday, 17 August 2026

DeepSeek V4 Flash was compressed to 57 GB and compiled a Mac compiler, proving extreme quantization works.