Como um Limite de Taxa Decide se Sua Requisição é Processada
Um limite de taxa define o número máximo de requisições que um cliente pode enviar em um determinado período e retorna 429 assim que esse limite é excedido. O limite existe para evitar que um cliente consuma a capacidade que pertence a todos, e é por isso que a resposta correta é diminuir o ritmo, em vez de reenviar a requisição imediatamente.
Tentar novamente de imediato é exatamente o que a maioria das primeiras integrações faz, e isso transforma uma recusa temporária em uma sustentada. O cliente atinge o limite, tenta novamente, estende o período de medição e acaba sendo limitado por muito mais tempo do que o pico original exigiria, geralmente enquanto um desenvolvedor conclui que a API não é confiável. Sua própria configuração de limite é propositalmente excluída: limites por nível, permissões de pico e os endpoints com limites mais rigorosos pertencem à documentação versionada, e não a um vídeo que envelhece.
O modelo acompanha uma requisição em oito cenas: uma sobre por que os limites existem, uma sobre o período e como ele é contado, uma sobre o que uma resposta 429 contém, duas sobre backoff e por que o atraso deve aumentar, uma sobre jitter e o thundering herd, uma sobre a leitura dos cabeçalhos de limite de taxa e uma sobre como projetar para que o limite raramente seja atingido.

