🖼️197197Popping the GPU Bubble | MoondreamHacker News·3 months ago#M8YTeGFN#moondream#photon#vlm#nvidia#article#ama+1 more🧰Tag tools✨Add tagPhoton, Moondream's inference engine, achieves near-realtime VLM inference (~33ms on NVIDIA B200). This is a peek into how it delivers up to 35% higher decode throughput by optimizing how the GPU works.15s0Read later0Read More