¿Cómo “aprende” una neurona artificial? – Redes Neuronales Artificiales

Por Antonio E. P. Heredia

Por Antonio E. P. Heredia
https://antonioeph.com/cv/
CV Online→

El aprendizaje de una neurona artificial (modelo matemático y computacional) es fácilmente definible cómo la búsqueda de los “mejores” parámetros que minimizan su función de costo u error, es decir, su proceso de aprendizaje es la actualización de sus parámetros mediante el proceso de optimización de una función que cuantifica “qué tan equivocadas están sus respuestas”. Esto se logra con un proceso llamado gradiente descendente para encontrar el argumento (los parámetros) de una función que la minimiza.

El modelo implica un vector de entradas o features, parámetros o pesos asociados a cada entrada, su combinación lineal y la función de activación (no linealidad) que proporciona la salida, predicción o clasificación de la neurona:

Neurona Artificial (modelo)

Neurona Artificial

Considerando la función de costo tradicional como la suma de los errores cuadrados SSE:

Función de costo

\displaystyle E=\frac{1}{2}\left(\sum _{n}\left( t^{( n)} -y^{( n)}\right)^{2}\right)

\displaystyle t: valor correcto conocido

\displaystyle y: predicción realizada

Con \displaystyle E^{( n)} =\frac{1}{2}\left( t^{( n)} -y^{( n)}\right)^{2}

Nota: el superscript \displaystyle (n) o índice superior derecho (no es un exponente) se refiere al ejemplo o muestra n de un conjunto de entrenamiento.

Y la función logística o “sigmoid” como la activación no lineal de la neurona sobre su logit (combinación lineal de entradas y parámetros):

Función logística de activación

\displaystyle y=\sigma (z)=\frac{1}{1+e^{-z}}

Además, considerando al logit con absorción del sesgo o bias \displaystyle b de la neurona cómo un parámetro más, definiendo la entrada \displaystyle x_0=1 y el parámetro \displaystyle w_0=b:

\displaystyle z=\sum _{i} w_{i} x_{i}=w^{T} x

Para obtener la regla de aprendizaje de la neurona artificial se debe diferenciar parcialmente a la función de costo respecto a cada parámetro o peso de la siguiente forma (para un batch gradient descent) :

    \begin{align*} \frac{\partial E}{\partial w_{i}} & =\frac{\partial }{\partial w_{i}}\left(\sum _{n} E^{( n)}\right)\\  & =\sum _{n}\frac{\partial }{\partial w_{i}} E^{( n)}\\  & =\sum _{n}\frac{dE^{( n)}}{dy^{( n)}}\frac{dy^{( n)}}{dz^{( n)}}\frac{\partial z^{( n)}}{\partial w_{i}} \end{align*}

Lo anterior es una especificación completa de la más simple propagación hacia atrás (backpropagation) para una sóla neurona, indicando las derivadas que se deben calcular. Y tomando en cuenta que la derivada de la función sigmoide es:

    \begin{align*} \frac{dy}{dz} & =\frac{d}{dz}\left(\frac{1}{1+e^{-z}}\right)\\  & =-\frac{1}{\left( 1+e^{-z}\right)^{2}} \cdot \frac{d}{dz}\left( e^{-z}\right)\\  & =-\frac{1}{\left( 1+e^{-z}\right)^{2}}\left( -e^{-z}\right)\\  & =\frac{e^{-z}}{\left( 1+e^{-z}\right)} \cdot \frac{1}{\left( 1+e^{-z}\right)}\\  & =\frac{\left( 1+e^{-z}\right) -1}{\left( 1+e^{-z}\right)} \cdot \frac{1}{\left( 1+e^{-z}\right)}\\  & =\left( 1-\frac{1}{\left( 1+e^{-z}\right)}\right)\left(\frac{1}{\left( 1+e^{-z}\right)}\right) \end{align*}

Por lo tanto, y por definición de \displaystyle y (con resultado anterior \displaystyle \frac{dy}{dz}&= (1-y)y), tenemos:

    \begin{align*} \sum _{n}\frac{dE^{( n)}}{dy^{( n)}}\frac{dy^{( n)}}{dz^{( n)}}\frac{\partial z^{( n)}}{\partial w_{i}} = & \sum _{n}\frac{1}{2} \cdot 2\left(\left( t^{( n)} -y^{( n)}\right)\right)( -1)\frac{dy^{( n)}}{dz^{( n)}}\frac{\partial z^{( n)}}{\partial w_{i}}\\ = & -\sum _{n}\left(\left( t^{( n)} -y^{( n)}\right)\right) y^{( n)}\left( 1-y^{( n)}\right)\frac{\partial z^{( n)}}{\partial w_{i}}\\ = & -\sum _{n}\left(\left( t^{( n)} -y^{( n)}\right)\right) y^{( n)}( 1-y) x_{i}^{( n)} \end{align*}

Expandido para un total de \displaystyle m ejemplos o muestras de un conjunto de entrenamiento, nos brinda una mejor comprensión sobre el proceso de diferenciación en cadena para las dependencias que presentan la función de costo, la función de activación y el logit:

    \begin{align*}  & =\frac{dE^{( 1)}}{dy^{( 1)}}\frac{dy^{( 1)}}{dz^{( 1)}}\frac{\partial z^{( 1)}}{\partial w_{i}} +\frac{dE^{( 2)}}{dy^{( 2)}}\frac{dy^{( 2)}}{dz^{( 2)}}\frac{\partial z^{( 2)}}{\partial w_{i}} +\cdot \cdot \cdot +\frac{dE^{( n)}}{dy^{( n)}}\frac{dy^{( n)}}{dz^{( n)}}\frac{\partial z^{( n)}}{\partial w_{i}} +\cdot \cdot \cdot +\frac{dE^{( m)}}{dy^{( m)}}\frac{dy^{( m)}}{dz^{( m)}}\frac{\partial z^{( m)}}{\partial w_{i}}\\  & =-\left( t^{( 1)} -y^{( 1)}\right) y^{( 1)}\left( 1-y^{( 1)}\right) x_{i}^{( 1)} -\left( t^{( 2)} -y^{( 2)}\right) y^{( 2)}\left( 1-y^{( 2)}\right) x_{i}^{( 2)} -\cdot \cdot \cdot \\  & \ \ \ \ \ -\left( t^{( n)} -y^{( n)}\right) y^{( n)}\left( 1-y^{( n)}\right) x_{i}^{( n)} -\cdot \cdot \cdot -\left( t^{( m)} -y^{( m)}\right) y^{( m)}\left( 1-y^{( m)}\right) x_{i}^{( m)}\\  & =-\sum _{n} x_{i}^{( n)} y^{( n)}\left( 1-y^{( n)}\right)\left( t^{( n)} -y^{( n)}\right) \end{align*}

Todo lo anterior para obtener la regla de aprendizaje:

    \begin{align*} w & \leftarrow w-\eta \nabla _{\mathbf{{\displaystyle W}}} E \end{align*}

Con el hiperparámetro \displaystyle \eta como el step size que determina que tan grande es la actualización de cada parámetro y \displaystyle \nabla _{W} E el vector de derivadas parciales de E respecto a cada parámetro, es decir, el gradiente.

    \begin{align*} \nabla _{\mathbf{{\displaystyle W}}} E =\begin{bmatrix} \frac{\partial E}{\partial w_{1}}\\ \frac{\partial E}{\partial w_{2}}\\ \vdots \\ \frac{\partial E}{\partial w_{d}} \end{bmatrix} & =\begin{bmatrix} \sum _{n}\frac{\partial E^{( n)}}{\partial w_{1}}\\ \sum _{n}\frac{\partial E^{( n)}}{\partial w_{2}}\\ \vdots \\ \sum _{n}\frac{\partial E^{( n)}}{\partial w_{d}} \end{bmatrix} \end{align*}

Recordando que: esto es el aprendizaje de una sóla neurona artificial, específicamente una que se encuentra en la capa de salida de la red.


Contenido elaborado por Antonio Enrique Pérez Heredia. CEFYM © 2026Licencia de Creative Commons
Este obra está bajo una licencia de Creative Commons Reconocimiento-NoComercial-SinObraDerivada 4.0 Internacional

+1
0
+1
0
+1
0
+1
0
+1
1

Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *