
El aprendizaje de una neurona artificial (modelo matemático y computacional) es fácilmente definible cómo la búsqueda de los “mejores” parámetros que minimizan su función de costo u error, es decir, su proceso de aprendizaje es la actualización de sus parámetros mediante el proceso de optimización de una función que cuantifica “qué tan equivocadas están sus respuestas”. Esto se logra con un proceso llamado gradiente descendente para encontrar el argumento (los parámetros) de una función que la minimiza.
El modelo implica un vector de entradas o features, parámetros o pesos asociados a cada entrada, su combinación lineal y la función de activación (no linealidad) que proporciona la salida, predicción o clasificación de la neurona:
Neurona Artificial (modelo)

Considerando la función de costo tradicional como la suma de los errores cuadrados SSE:

valor correcto conocido
predicción realizada
Con ![]()
Nota: el superscript
o índice superior derecho (no es un exponente) se refiere al ejemplo o muestra n de un conjunto de entrenamiento.
Y la función logística o “sigmoid” como la activación no lineal de la neurona sobre su logit (combinación lineal de entradas y parámetros):
![]()
Además, considerando al logit con absorción del sesgo o bias
de la neurona cómo un parámetro más, definiendo la entrada
y el parámetro
:
![]()
Para obtener la regla de aprendizaje de la neurona artificial se debe diferenciar parcialmente a la función de costo respecto a cada parámetro o peso de la siguiente forma (para un batch gradient descent) :

Lo anterior es una especificación completa de la más simple propagación hacia atrás (backpropagation) para una sóla neurona, indicando las derivadas que se deben calcular. Y tomando en cuenta que la derivada de la función sigmoide es:

Por lo tanto, y por definición de
(con resultado anterior
), tenemos:

Expandido para un total de
ejemplos o muestras de un conjunto de entrenamiento, nos brinda una mejor comprensión sobre el proceso de diferenciación en cadena para las dependencias que presentan la función de costo, la función de activación y el logit:

Todo lo anterior para obtener la regla de aprendizaje:

Con el hiperparámetro
como el step size que determina que tan grande es la actualización de cada parámetro y
el vector de derivadas parciales de E respecto a cada parámetro, es decir, el gradiente.

Recordando que: esto es el aprendizaje de una sóla neurona artificial, específicamente una que se encuentra en la capa de salida de la red.
| Contenido elaborado por Antonio Enrique Pérez Heredia. CEFYM © 2026 | ![]() Este obra está bajo una licencia de Creative Commons Reconocimiento-NoComercial-SinObraDerivada 4.0 Internacional |

Academia
Lic. en Física (UAM I), Ing. en Sistemas Computacionales (IPN-ESCOM), Lic. en Matemáticas (UNADM), Lic. en Filosofía (UACH), Lic. en Estadística (UNACH), Lic. en Psicología (UNAM – Iztacala), Lic. en Mercadotecnia y Ventas (URC), Lic. en Derecho (BUAP), Lic. en Biología (UNAM – FAC Ciencias), Lic. en Diseño Gráfico y Animación Digital (UAT) y cursando Maestría en Ciencias de la Complejidad (UACM).
Industria
Desarrollador de Sistemas (Web) Sr., Systems Analyst Sr. y profesor de Matemáticas/Física/Computación.
“Most people would sooner die than think; in fact, they do so.” — Bertrand Russell





