I wonder if I can run it on a server with 128gb of RAM and 16gb of VRAM (or even just using ik's cpu optimized inference)
Sung KimAlibaba Ant's Ling-3.0-flash (open-weight) Official BF16 and FP8-quantized versions are now available. 🤗 Hugging Face Official: huggingface.co/inclusionAI/... FP8: huggingface.co/inclusionAI/...