Otimização de Preços no Varejo Brasileiro: Uma Abordagem Baseada em Aprendizado por Reforço e Variáveis Macroeconômicas
Precificação Dinâmica. Aprendizado por Reforço Profundo. PPO. LSTM. Varejo.
Em mercados varejistas caracterizados por volatilidade, sazonalidade e elevada dimensionalidade informacional, a precificação dinâmica assume papel estratégico na otimização de receita e preservação de margens. Este trabalho investiga a aplicação de Aprendizado por Reforço Profundo (Deep Reinforcement Learning – DRL) à precificação dinâmica no varejo brasileiro, propondo uma arquitetura integrada baseada no algoritmo Proximal Policy Optimization (PPO) e em redes recorrentes Long Short-Term Memory (LSTM). O problema é formalizado como um Processo de Decisão de Markov (MDP) aumentado, incorporando variáveis microeconômicas, indicadores macroeconômicos e sinais prospectivos de demanda ao vetor de estado do agente. A pesquisa estruturou-se em três fases: (i) Revisão Sistemática da Literatura (RSL), sob o protocolo PRISMA, que identificou lacunas na integração de variáveis exógenas e na estabilidade de políticas em espaços de ação contínuos; (ii) desenvolvimento de um ambiente de simulação estocástico calibrado com dados reais; e (iii) experimentação comparativa frente a políticas baseline contrafatuais, incluindo reajustes indexados a índices oficiais (DIEESE). A configuração experimental consolidada (V8) alcançou receita acumulada de R$ 142,043 milhões, superando o baseline mais competitivo em 0,9845% (+R$ 1,38 milhão), mantendo estabilidade operacional e trajetórias de preço economicamente coerentes ao longo de 106 timesteps. Os resultados validam a eficácia da arquitetura forecast–control na mitigação da miopia decisória e na captura de ganhos marginais em escala, oferecendo um arcabouço formalmente robusto e reprodutível para a gestão de preços em ambientes de alta complexidade.