Skip to Main Content
texto

Resumen de optimización bayesiana: metodología efectiva para explorar hiperparámetros en modelos de aprendizaje profundo

La optimización bayesiana es una metodología eficaz para encontrar los mejores valores de hiperparámetros para mejorar los modelos de aprendizaje profundo. Aprenda a aplicarlo a los modelos de aprendizaje de IA para obtener el mejor rendimiento.
A blue and purple toned abstract wave image overlayed with geometric block pattern that resembles a mathematical graph.

Conclusiones clave 

Este artículo muestra cómo la optimización bayesiana es la forma más eficaz de explorar hiperparámetros para mejorar el rendimiento del modelo. La optimización de hiperparámetros en el Deep Learning se puede realizar de muchas maneras: búsqueda manual, búsqueda en cuadrícula, búsqueda aleatoria y optimización bayesiana.  

¡Atención! Este artículo está destinado para: 

  • Personas que tienen una comprensión básica de cómo funcionan los algoritmos de aprendizaje profundo, así como técnicas como la regularización
  • Personas que tienen un conocimiento básico de Python y TensorFlow
     

El objetivo de esta publicación no es proporcionarle una comprensión profunda de la optimización bayesiana, sino brindarle una comprensión básica de la optimización bayesiana para que pueda aplicarla sin problemas a la optimización de hiperparámetros en modelos de aprendizaje profundo. En consecuencia, hemos intentado evitar referencias a matemáticas fuera del Deep Learning tanto como sea posible al explicar los principios generales de la optimización bayesiana, pero tenga en cuenta que algunas matemáticas pueden aparecer para respaldar las explicaciones.

Introducción

Optimización de hiperparámetros se refiere al problema de explorar el valor óptimo de un hiperparámetro, un valor que debe establecerse con anticipación para realizar el aprendizaje. En este contexto, el valor óptimo de un hiperparámetro se refiere al valor del hiperparámetro que da como resultado el mejor rendimiento generalizado del modelo de aprendizaje entrenado.

Por ejemplo, al entrenar un modelo de aprendizaje profundo, la tasa de aprendizaje, el tamaño del minilote, el coeficiente de regularización L2, etc. son hiperparámetros típicos. Por supuesto, esos hiperparámetros están estrictamente relacionados con el algoritmo de aprendizaje o la regularización y, en algunos casos, los factores que determinan la estructura de un modelo de aprendizaje profundo (p. ej., cantidad de capas, tamaño del filtro de circunvolución, etc.) también pueden considerarse hiperparámetros y agregarse como objetos de exploración.

 

Búsqueda manual

Si ha entrenado un modelo de aprendizaje profundo al menos una vez, sin duda ha experimentado mucho ensayo y error al determinar los valores de estos hiperparámetros clave. Por ejemplo, cuando realizamos una implementación del modelo AlexNet, generalmente comenzamos tomando los hiperparámetros introducidos en el documento original de AlexNet y aplicándolos al aprendizaje. Sin embargo, en la mayoría de las situaciones, el conjunto de datos utilizado en el documento AlexNet original y el conjunto de datos que desea utilizar son diferentes, por lo que los valores de hiperparámetros introducidos en el documento original rara vez son la solución perfecta para el problema que intenta resolver.

Cuando se enfrente a esta situación, normalmente confiará en su intuición o conocimiento popular para seleccionar los valores de hiperparámetros candidatos para probar a continuación, realizar el aprendizaje con ellos y registrar los resultados de desempeño medidos en comparación con el conjunto de validación. Después de repetir este proceso algunas veces, probablemente habrá elegido los valores de hiperparámetros que mejor se desempeñaron en comparación con el conjunto de validación entre todos los intentos hasta ese punto para capacitar el modelo de aprendizaje profundo para la presentación final. Este método de exploración para obtener valores óptimos de hiperparámetros se conoce como búsqueda manual.

Si bien la búsqueda manual es el método más intuitivo de optimización de hiperparámetros, tiene algunos problemas. La primera es que el proceso de encontrar el hiperparámetro “óptimo” se basa más bien en la suerte. Por ejemplo, describamos el proceso de realizar una búsqueda manual para encontrar la tasa de aprendizaje óptima para un modelo de aprendizaje profundo. Es muy probable que haya un límite de tiempo en este proceso, y probablemente se impaciente mucho, pensando:

Necesito que este modelo de aprendizaje profundo se desempeñe rápidamente, y mi profesor o jefe sigue presionándome, y no tengo tiempo... Estoy en problemas :’(

unluck-in-manual-search-process.gif
Ejemplo de resultados desafortunados de una búsqueda manual de la tasa de aprendizaje

Supongamos que tiene una cantidad limitada de tiempo para entrenar un modelo de aprendizaje profundo y medir su desempeño aplicando 9 valores de tasa de aprendizaje diferentes en secuencia: 0.01, 0.05, 0.03, 0.02, 0.025, 0.0225, 0.0275, 0.015, 0.04, y el resultado es el resultado superior en la figura anterior, así que elige 0.0025
como el valor final de la tasa de aprendizaje. Este proceso de exploración probablemente fue una aplicación cuidadosa de su propia intuición con cada sesión de aprendizaje, y es muy difícil para cualquier persona negar que los resultados de un proceso tan meticuloso sean los mejores resultados posibles.

Sin embargo, ¿qué pasaría si “la función de desempeño de generalización (desconocida) como una función sobre la tasa de aprendizaje” realmente tuviera un aspecto similar a la segunda imagen anterior? Si bien 0.0025 en realidad no fue el valor óptimo de la tasa de aprendizaje (los valores entre 0.003 y 0.0035 son óptimos), podemos especular que su impaciencia y sesgo en el proceso de exploración manual existente ocasionaron resultados decepcionantes. Es posible que hayamos señalado involuntariamente un error que haya cometido en el pasado, pero no es completamente su culpa. La desventaja de realizar una búsqueda manual basada en la subjetividad y la intuición es que es relativamente difícil garantizar que los valores óptimos del hiperparámetro que usted encuentra son “realmente” óptimos, como se muestra en el ejemplo anterior.

El segundo problema con la búsqueda manual es que se vuelve más complicado cuando desea explorar varios tipos de hiperparámetros a la vez. El mejor ejemplo de esto es la relación entre la tasa de aprendizaje y el coeficiente de regularización L2.

L(W)=1Ni=1NLi(f(xi,W),yi)+λR(W)L(W)=1N∑i=1NLi(f(xi,W),yi)+λ⋅R(W)

El segundo término en la función de pérdida anterior es el término de regularización L2, donde al cambiar el valor de λ, el coeficiente de regularización L2, (en todo el espacio del parámetro  W del modelo de aprendizaje profundo) también cambiará la forma de las funciones de pérdida  L(W). Debido a esto, podemos suponer que el valor de la tasa de aprendizaje óptima para un desempeño óptimo también cambiará naturalmente.

Debido a que algunos de estos hiperparámetros tienen una influencia mutua entre sí, se vuelve muy difícil aplicar la intuición existente a cada hiperparámetro cuando se explora más de uno a la vez.

 

Búsqueda en cuadrícula frente a búsqueda aleatoria

En comparación con la búsqueda manual, la búsqueda en cuadrícula y la búsqueda aleatoria son formas relativamente sistemáticas de realizar la optimización de hiperparámetros.

La búsqueda en cuadrícula selecciona valores de hiperparámetros candidatos a intervalos regulares dentro de un rango específico para explorar, registra el rendimiento medido para cada uno de ellos y luego selecciona el valor de hiperparámetros que mostró el mejor rendimiento. Si bien este método aún requiere un toque humano para decidir cuántos intervalos buscar, a qué longitud establecer los intervalos, etc., tiene la ventaja de una exploración más uniforme y amplia en comparación con la búsqueda manual. Sin embargo, la compensación es que con este método, el tiempo de exploración general aumenta exponencialmente a medida que aumenta el número de hiperparámetros objetivo de exploración.

grid-search-process.gif
Ejemplo de proceso de búsqueda en cuadrícula para la tasa de aprendizaje

Por otro lado, la búsqueda aleatoria es ampliamente similar a la búsqueda en cuadrícula, pero difiere en que utiliza muestreo aleatorio para seleccionar valores de hiperparámetros candidatos dentro del intervalo que se explora. Se sabe que la búsqueda aleatoria encuentra valores de hiperparámetros óptimos más rápido que la búsqueda en cuadrícula, ya que reduce significativamente la cantidad de repeticiones innecesarias y, al mismo tiempo, puede explorar probabilísticamente los valores que se encuentran entre las cuadrículas designadas.

random-search-process.gif
Ejemplo de proceso de búsqueda aleatoria para la tasa de aprendizaje
(Resultado de la ejecución de la función aleatoria de Python 10 veces en intervalos 
[0.01, 0.05 | ; random.seed=0)

Sin embargo, puede ser difícil quitarle la sensación de que incluso la búsqueda aleatoria “todavía parece un poco de exploración innecesaria”. Esto se debe a que, tanto en la búsqueda en cuadrícula como en la búsqueda aleatoria, el proceso de seleccionar valores de hiperparámetros candidatos para probar a continuación no refleja ningún conocimiento previo del rendimiento de los valores de hiperparámetros durante investigaciones anteriores. En la búsqueda manual, por otro lado, el conocimiento previo se aplica implícitamente todas las veces.

grid-search-vs-random-search.avif
Ejemplo de comparación de resultados de búsqueda en cuadrícula y búsqueda aleatoria
[Bergstra y Bengio (2012)]

La optimización bayesiana es una metodología que le permite realizar sistemáticamente todo el proceso de exploración y, al mismo tiempo, reflejar el conocimiento previo suficiente para investigar de manera eficaz nuevos valores de hiperparámetros cada vez.

 

Optimización bayesiana

En esencia, la optimización bayesiana tiene como objetivo encontrar la solución óptima 
x dada una función objetiva desconocida f que maximiza la función 
f(x) dado algún valor de entrada x. Por lo general, asumimos que no conocemos explícitamente la expresión de la función objetiva (es decir, la función de caja negra) y que lleva mucho tiempo calcular un valor de función f(x). En esta situación, el objetivo principal es encontrar de manera rápida y eficiente la solución óptima que maximice f(x), xexaminando secuencialmente los valores de función para la menor cantidad posible de valores de entrada candidatos.

Hay dos elementos esenciales para la optimización bayesiana. En primer lugar, un modelo sustituto hace una estimación probabilística de la forma de una función objetiva desconocida basada en el valor de entrada y los puntos de valor de función (x1,f(x1)),...,(xt,f(xt)) que se han investigado hasta el momento. Luego, la función de adquisición recomienda el siguiente "más probable que sea útil para encontrar la entrada óptima x", los candidatos de entrada xt+1, en función de la estimación probabilística actual de la función objetiva.

bayesian-optimization-algorithm.avif
Seudocódigo para algoritmos de optimización bayesiana

 

Modelo sustituto

El modelo que hace una estimación probabilística de la forma aproximada de la función de objetivo desconocida, basada en el valor de entrada y los puntos de valor de función (x1,f(x1)),...,(xt,f(xt)) examinados hasta ahora, se denomina modelo sustituto. El modelo probabilístico más popular utilizado como modelo sustituto es el Proceso Gaussiano (Gaussian Process, GP).

 

Procesos gaussianos

A diferencia de los modelos de probabilidad ordinarios (que expresan distribuciones de probabilidad sobre cualquier variable dada), los GP representan distribuciones de probabilidad sobre un conjunto de funciones y se caracterizan por el hecho de que la distribución conjunta entre sus componentes sigue una distribución gaussiana. GP utiliza una función media μ y una función de covarianza k para expresar la distribución de probabilidad sobre las funciones.

f(x)GP(μ(x),k(x,x)).f(x)∼GP(μ(x),k(x,x′)).

Para comprender y usar correctamente GP, debe tener una comprensión básica de la probabilidad bayesiana y ser capaz de comprender fórmulas algebraicas estocásticas/lineales complejas. Esta publicación no entrará en más detalle, pero se centrará en las características operativas de los GP y en cómo pueden utilizarse para la optimización de hiperparámetros.

Dados los puntos de valor de la función de valor de entrada investigados hasta el momento (x1,f(x1)),...,(xt,f(xt)), GP hace una estimación probabilística de la función objetiva como se muestra en la figura a continuación.

bayesian-optimization-procedure-example.avif
Ejemplo de proceso de optimización bayesiana con GP
(Línea punteada negra: función objetivo real, línea continua negra: función media estimada, sombreado azul: desviación estándar estimada, puntos negros: valor de entrada y puntos de valor de función investigados hasta la fecha, línea continua verde en la parte inferior: función de adquisición) [Brochu et al. (2010)]

En la figura anterior, si consideramos que el eje horizontal es el valor de entrada 
x y el eje vertical será el valor de función f(x), luego la línea negra sólida se estima en función de los puntos (x1,f(x1)),...,(xt,f(xt)) examinados hasta el momento para mostrar la “media” x en cada ubicación μμ(x), y la línea sombreada azul corresponde a la “desviación estándar” en cada ubicación σσ(x). Para μ μ(x), la forma se determina necesariamente pasando a través de los puntos (x1,f(x1)),...,(xt,f(xt)) que se han investigado hasta ahora, siendo σ(x) más pequeño para ubicaciones más cercanas a los puntos investigados y σ σ(x) más grande para ubicaciones más lejanas. La implicación natural de esto es que cuanto más lejos x esté del punto investigado, mayor será la “incertidumbre” en el valor promedio estimado para ese punto.

En la figura anterior, cuando es t=2 ya que solo se investigan dos puntos de valor de entrada, podemos observar que σ(x) es grande en la mayoría de las áreas que están al menos a cierta distancia de estos dos puntos. Mientras tanto, a medida que la cantidad de puntos investigados aumenta gradualmente a t=3 t=4, el tamaño de las áreas con σ σ(x) grande disminuye gradualmente, y la estimación de la función objetivo real se comprime gradualmente. Esto muestra que a medida que aumenta la cantidad de puntos investigados, disminuye la incertidumbre sobre la estimación de la función objetiva, y podemos suponer que a medida que esta tendencia se vuelve más fuerte, la probabilidad de encontrar el valor de entrada X que maximiza el numerador de la función objetiva continuará aumentando.

 

Modelos sustitutos distintos de GP

Además de GP, cualquier modelo que pueda cubrir la incertidumbre en la estimación de la función objetiva basada en el valor de entrada y los puntos de valor de la función investigados hasta el momento puede utilizarse como un modelo sustituto. Los modelos sustitutos comúnmente utilizados además de GP incluyen estimadores Parzen estructurados en árboles (TPE) y redes neuronales profundas.

En el mismo contexto que GP, incluso si no tiene una comprensión profunda de estos modelos sustitutos, si comprende el contexto más amplio de la optimización bayesiana, aún puede realizar la optimización bayesiana utilizando bibliotecas relacionadas.

 

Función de adquisición

En función de las estimaciones probabilísticas del modelo sustituto de la función objetiva hasta la fecha, la función que recomienda los valores de entrada candidatos xt+1
para investigar a continuación se denomina función de adquisición. Se mencionó que la selección de xt+1 es, en última instancia, “la más útil” para encontrar el valor de entrada óptimox para la función objetiva. Pensemos en lo que queremos decir con “útil” en este contexto. Para fines ilustrativos, hemos traído de vuelta la cifra que muestra la situación en t=2 durante el proceso de estimación de la función objetiva utilizando GP.

bayesian-optimization-procedure-example-teq2.avif
Qué sucede cuando t=2 durante la optimización bayesiana usando GP

Dado que solo hay puntos (x,f(x)) que se han investigado hasta el momento, es posible predecir que el verdadero valor de entrada óptimo es más probable que se encuentre cerca del punto con el valor de función más grande (el de la derecha en la figura). Naturalmente, una estrategia razonable para probar a continuación sería probar el área alrededor del punto con el mayor valor de función entre los puntos investigados hasta ahora. Esto se denomina oficialmente “explotación”.

Pensemos en ello desde una perspectiva diferente esta vez. Intuitivamente, puede sentir que para el área que se encuentra entre los dos puntos investigados hasta el momento y tiene una gran desviación estándar (=incertidumbre)  Σ Σ(X), será muy difícil garantizar que el valor medio estimado de la función en esta parte será similar al valor real de la función objetiva. Desde esa perspectiva, es plausible pensar que existe la posibilidad de que exista el valor de entrada óptimo X en esta área incierta, y debemos explorarlo más”, y por lo tanto, es una estrategia razonable probar junto al punto con la desviación estándar más grande sobre la función objetiva estimada hasta ahora. Esto se denomina oficialmente “exploración”.

Si bien las estrategias de exploración y explotación son enfoques igualmente importantes para encontrar de manera efectiva el valor de entrada óptimo x, el problema es que la naturaleza de las dos estrategias es una compensación. Por lo tanto, ajustar adecuadamente la intensidad relativa de la compensación de exploración/explotación es fundamental para identificar con éxito la entrada óptima para la función objetiva real.

 

Mejora esperada (EI)

La función de mejora esperada (EI) está diseñada para incluir algunos aspectos de las estrategias de exploración y explotación, y se utiliza con mayor frecuencia como una función de adquisición. En función de la función objetiva estimada hasta la fecha, para cualquier entrada candidato x, teniendo en cuenta la probabilidad de mejora (PI) de producir un valor de función f(x1),...,f(xt) mayor que la salida máxima f(x+)=maxif(xi) de los puntos examinados hasta la fecha y la magnitud de la diferencia entre ese valor de función y F(X+), el EI emite un número que representa la “utilidad” de ese valor de entrada x. Aquí, veamos la figura a continuación para comprender el concepto de PI.

probability-of-improvement-in-gaussian-process-example.avif
Visualización de ejemplo de la probabilidad de derivar un valor de función mayor que el valor de función máximo f(x+) (PI) cuando se usa GP (línea punteada vertical: distribuciones de probabilidad para cada uno de los valores de función f(x1), f(x2) y f(x3) en los valores de entrada x1, x2 y x3, respectivamente, sombreado verde: áreas en la distribución de probabilidad de f(x3) donde su valor es mayor que f(x+)) [Brochu et al. (2010)]

 

En la figura anterior, el valor de función más grande f(x+) de los puntos investigados hasta el momento se produjo en el punto a la derecha. Aquí, para el valor de entrada candidato x3, que está más a la derecha, la distribución de probabilidad de 
f(x3) (a lo largo del eje vertical) basado en la estimación probabilística puede representarse como una distribución gaussiana sesgada, como se muestra en la figura.

Mientras tanto, el área de la distribución de probabilidad de f(x3) que corresponde a valores mayores que f(x+) está sombreada en verde en la figura. El tamaño más grande de esta área indica que es más probable que f(x3) sea mayor que f(x+), lo que lleva a la conclusión de que tomar x3 como el siguiente valor de entrada es más probable que arroje un valor de función más grande que los puntos existentes, y que para encontrar la entrada óptima x∗ a la función objetiva, x3 es el candidato “más útil”.

El valor de PI calculado para el valor de entrada x3 luego se pondera para la función f(x3), por la diferencia entre el promedio μ μ(x3) y f
(x+),f(x3)−f(x+) para calcular finalmente el valor de EI para x3. Es importante encontrar un punto que tenga una mayor probabilidad de obtener un valor de función mayor que los puntos existentes, pero si existe esa probabilidad, también es importante considerar cuánto más grande es realmente., y este cálculo pretende reflejar eso.

Como referencia, la fórmula para EI cuando se usa GP puede resumirse y expresarse de la siguiente manera (después de un largo proceso de derivación). En la siguiente fórmula, los caracteres 
Φ y ϕϕ denotan la función de distribución acumulativa (CDF) y la función de distribución de probabilidad (PDF) de la distribución normal estándar, respectivamente, y es un parámetro que controla la fortaleza relativa entre la exploración y la explotación. Cuanto más grande sea ξi s, más fuerte será la exploración, y cuanto más pequeña sea, más fuerte será la explotación.

Para la situación en t=4 en el proceso de estimación de la función objetiva usando GP anterior, el resultado de calcular el valor de EI para cada valor de entrada x, EI(
x) usando la fórmula de EI anterior, se muestra como la línea continua verde en la parte inferior de la figura a continuación.

bayesian-optimization-procedure-example-teq4.avif
Qué sucede cuando t = 4 durante la optimización bayesiana usando GP

De hecho, podemos observar simultáneamente en la figura que el valor de EI es grande (estrategia de explotación) alrededor del punto x+, que tiene el valor de función más grande entre los puntos investigados hasta el momento, y que el valor de EI también es grande alrededor del punto con la desviación estándar más grande σσ(x) en la función objetiva estimada hasta el momento (estrategia de exploración).

EI(x)=E[max(f(x)−f(x+),0)]={(μ(x)−f(x+)−ξ)Φ(Z)+σ(x)ϕ(Z) ifσ(x)>00ifσ(x)=0

 

Funciones de adquisición que no sean EI

La probabilidad de mejora (PI) es una función de adquisición que se propuso antes que la EI, que refleja solo la probabilidad de derivar un valor de función mayor que el valor de función máximo de los puntos investigados hasta la fecha entre las consideraciones de la EI. Otras funciones de adquisición comúnmente utilizadas incluyen el límite superior de confianza (UCB) y la búsqueda de entropía (ES).

 

Realización de la optimización bayesiana para explorar hiperparámetros en modelos de aprendizaje profundo

Hasta ahora, hemos cubierto los elementos esenciales de la optimización bayesiana y cómo funcionan básicamente. Ahora, visualicemos con más detalle un escenario en el que se aplica la optimización bayesiana al explorar realmente los hiperparámetros de un modelo de aprendizaje profundo. Para mayor comodidad, solo se analiza la tasa de aprendizaje aquí como el hiperparámetro que se debe explorar.

bayesian-optimization-process.gif
Ejemplo de proceso de optimización bayesiana (GP, EI) para la tasa de aprendizaje
(Resultados de las primeras 3 rondas (n = 3) en el intervalo [0.01, 0.09], para un total de 11 (N = 11) puntos;
superior: resultados de la estimación estocástica de GP de la función objetiva f(x), inferior: resultados de la computación de la función EI para la estimación estocástica;
usando la biblioteca de optimización bayesiana, random_seed=1)
  1. Define el valor de entrada, la función objetiva y otros ajustes.
    1. Valor de entrada x: valor de aprendizaje Función objetiva f(x)
    2. Resultados de desempeño (p. ej., precisión) en un conjunto de validación para un modelo de aprendizaje profundo aprendido aplicando una tasa de aprendizaje establecida
    3. Se exploraron los intervalos objetivo del valor de entrada x: (a,b).
    4. Cantidad de puntos de valor de entrada y valor de función que se investigarán primero: n
    5. Número máximo de puntos de valor de entrada y valor de función que se investigarán hasta la última ronda: N
  2. Dentro del intervalo diana de exploración establecido (a,b), los valores de entrada n
    seleccionados inicialmente se muestrean y seleccionan aleatoriamente.
  3. Después de entrenar el modelo de aprendizaje profundo estableciendo los valores de la tasa de aprendizaje para cada una de las n entradas seleccionadas x1,x2,...,xn, calcule los resultados de desempeño del modelo aprendido utilizando el conjunto de validación. Cada uno de estos se considera un valor de función f(x1),f(x2),...,f(xn). Los valores de entrada n se muestrean y seleccionan aleatoriamente.
  4. La estimación probabilística se realiza utilizando el modelo sustituto en la recopilación del valor de entrada y los puntos de valor de función (x1,f(x1)),(x2,f(x2)),...,(xn,f(xn)).
  5. Hasta que alcance un total de NN valores de entrada inspeccionados y puntos de valor de función, el siguiente proceso se repite para t=n,n + 1,...,N − 1.
    1. En función de los resultados de estimación probabilística del modelo sustituto para la recopilación (x1,f(x1)),(x2,f(x2)),...,(xt,f(xt)) o de los puntos de valor de entrada y valor de función existentes, calcule el valor de EI dentro del intervalo de entrada (a,b) y seleccione el punto con el valor más grande como el siguiente valor de entrada candidato xt+1.
    2. Después de entrenar el modelo de aprendizaje profundo con el siguiente valor de entrada candidato xt +1 como valor de la tasa de aprendizaje, utilice el conjunto de validación para calcular el resultado de desempeño para el modelo aprendido y considerarlo como el valor f(xt +1).
    3. Agregue los nuevos puntos (xt+1, f(xt+1)) a la recopilación existente de puntos de valor de entrada y valor de función y realice una estimación probabilística con el modelo sustituto nuevamente en la recopilación actualizada de puntos.
  6. En función de los resultados de la función objetiva estimados probabilísticamente sobre un valor de entrada total de N y puntos de valor de función, seleccione la solución óptima que maximice la función media μ μ(x),x. Más tarde, si realiza el aprendizaje en un modelo de aprendizaje profundo utilizando ese valor  x* como la tasa de aprendizaje, obtendrá un modelo con un rendimiento de generalización maximizado.

     

Conclusión

La optimización de hiperparámetros en el Deep Learning se refiere al problema de explorar el valor óptimo de un hiperparámetro, un valor que debe establecerse con anticipación para realizar el aprendizaje en un modelo de aprendizaje profundo. Los hiperparámetros típicos para entrenar modelos de aprendizaje profundo incluyen la tasa de aprendizaje, el tamaño del minilote y el coeficiente de regularización L2.

El método más simple e intuitivo para la optimización de hiperparámetros es la búsqueda manual comúnmente utilizada, que implica seleccionar subjetivamente los valores de hiperparámetros candidatos para probar en cada ronda, aprender con ellos y registrar los resultados de desempeño medidos contra un conjunto de validación. Este método tiene la desventaja de que es relativamente difícil encontrar valores óptimos de hiperparámetros debido al sesgo implícito del experimentador en el proceso de encontrar el hiperparámetro óptimo. Si bien la búsqueda en cuadrícula y la búsqueda aleatoria pueden compensar las deficiencias de la búsqueda manual, son limitadas porque no reflejan ningún conocimiento previo obtenido durante la investigación del hiperparámetro.

La optimización bayesiana es una metodología de optimización de hiperparámetros que puede hacer que el proceso de exploración general sea más sistemático y, al mismo tiempo, reflejar suficiente conocimiento previo al investigar nuevos valores de hiperparámetros cada vez. Un modelo sustituto, uno de los dos componentes de la optimización bayesiana, hace una estimación probabilística de alguna función objetiva desconocida basada en el valor de entrada y los puntos de valor de función examinados hasta la fecha. Un ejemplo típico de esto es el proceso gaussiano (Gaussian Process, GP). Mientras tanto, la función de adquisición recomienda el siguiente valor de entrada candidato que es más probable que sea útil para encontrar el valor de entrada óptimo basado en la estimación probabilística actual de la función objetiva. Un ejemplo típico de esto es la mejora esperada (Expected Improvement, EI).

Utilice la optimización bayesiana para la optimización de hiperparámetros de modelos de aprendizaje profundo aplicando hiperparámetros para explorar los valores óptimos como el valor de entrada de la optimización bayesiana y utilizando los resultados de rendimiento del conjunto de validación de un modelo de aprendizaje profundo aplicando valores de hiperparámetros específicos como un valor de función de la función objetiva.

*En la siguiente parte, aprovecharemos la comprensión obtenida hasta ahora y repasaremos el proceso de explorar la solución óptima de una función de ejemplo simple utilizando la optimización bayesiana, una biblioteca de Python para la optimización bayesiana del mundo real y luego exploraremos los hiperparámetros óptimos de un modelo de aprendizaje profundo del mundo real.

 

Referencias

 

 

 

EI(x)=E[max(f(x)f(x+),0)]={(μ(x)f(x+)ξ)Φ(Z)+σ(x)ϕ(Z)ifσ(x)>00ifσ(x)=0EI(x)=E[max(f(x)f(x+),0)]={(μ(x)f(x+)ξ)Φ(Z)+σ(x)ϕ(Z)ifσ(x)>00ifσ(x)=0EI(x)=E[max(f(x)f(x+),0)]={(μ(x)f(x+)ξ)Φ(Z)+σ(x)ϕ(Z)ifσ(x)>00ifσ(x)=0EI(x)=E[max(f(x)f(x+),0)]={(μ(x)f(x+)ξ)Φ(Z)+σ(x)ϕ(Z)ifσ(x)>00ifσ(x)=0

Última modificación el01/01/2025

Recursos relacionados