Which THREE factors should you consider when tuning your inference endpoint for cost-efficiency?
Proper scaling prevents over-provisioning.
Why this answer
Instance type, auto-scaling configuration, and model optimization (like quantization) are critical levers for cost efficiency.