Aprendizaje basado en instancias y aprendizaje basado en modelos.
06/03/2024 2024-04-03 9:30Aprendizaje basado en instancias y aprendizaje basado en modelos.
Aprendizaje basado en instancias y aprendizaje basado en modelos.
Editado por Pier Giuseppe Giribone
Otra forma de categorizar los sistemas de aprendizaje se basa en su capacidad de generalización.
La mayoría de los objetivos previstos de los algoritmos de aprendizaje automático se centran en su capacidad para realizar predicciones. Esto significa que, a partir de una serie de ejemplos con los que entrenar, el sistema debe ser capaz de hacer buenas predicciones sobre datos nuevos o previamente desconocidos.
Encontrar buenas métricas de rendimiento en los datos de entrenamiento (" dentro de la muestra ") es sin duda positivo, pero no es suficiente, ya que el objetivo real es obtener resultados fiables en nuevas instancias.
Por lo tanto, las mediciones " fuera de muestra " representan la mejor herramienta para verificar si el sistema ha sido capaz de generalizar correctamente el conocimiento adquirido durante el entrenamiento.
Existen dos enfoques principales para la generalización: el aprendizaje basado en instancias y el aprendizaje basado en modelos.
La forma más simple de aprendizaje, que se incluye en la primera categoría, es simplemente aprender de memoria. Esto significa que si diseñáramos un filtro de spam que siguiera esta heurística, marcaría como spam todos los correos electrónicos que fueran exactamente idénticos a los que otros usuarios ya han clasificado de esta manera. Probablemente no sea la peor solución al problema, pero sin duda no es la mejor.
En lugar de marcar como spam los correos idénticos a los ya reconocidos, el algoritmo podría programarse para marcar también los correos muy similares a los spam conocidos. Este enfoque de diseño, si bien es obviamente más razonable, requiere una medida de similitud entre dos correos.
Una medida de similitud muy sencilla podría representarse, por ejemplo, mediante el número de palabras en común que tienen dos correos electrónicos: el sistema los marcará como spam si la comparación entre el nuevo correo y los que ya se sabe que son spam revela muchas palabras en común.
Esta forma de aprendizaje se denomina aprendizaje basado en instancias : el algoritmo aprende los ejemplos proporcionados durante el entrenamiento con la mayor fidelidad posible y, a continuación, generaliza este conocimiento a nuevos casos utilizando una medida de similitud para compararlo con elementos ya conocidos (o un subconjunto de estos).
Otra forma de generalizar a partir de un conjunto de ejemplos es construir un modelo matemático de una posible relación entre esos ejemplos y usarlo para hacer predicciones. Este tipo de generalización se denomina aprendizaje basado en modelos.
Supongamos que tenemos un conjunto de datos que se puede representar mediante un diagrama de dispersión, es decir, con puntos dispuestos en un plano cartesiano. Este podría ser el caso, por ejemplo, de la relación entre el Índice para una Vida Mejor de la OCDE (Organización para la Cooperación y el Desarrollo Económicos) (https://www.oecdbetterlifeindex.org) y el PIB per cápita (Producto Interno Bruto).
Si bien es sabido que el dinero por sí solo no puede brindar la felicidad, las estadísticas demuestran claramente que puede utilizarse como una herramienta para ayudar a las personas a alcanzar este noble objetivo, teniendo en cuenta, obviamente, la ética y el respeto mutuo hacia los demás habitantes presentes y futuros de nuestro planeta.
Por lo tanto, se observaría una línea de tendencia positiva entre la variable dependiente (puntuación del índice, eje y del gráfico) y la variable independiente (PIB per cápita, eje x del gráfico). Los puntos se alinearían, con una aproximación razonable, a lo largo de esta línea de tendencia creciente. El modelo matemático que podría representar adecuadamente esta relación es, por consiguiente, lineal. Esto se puede expresar en la forma Puntuación = θ0 + θ1 * PIB.
La fase descrita se denomina selección de modelo : es decir, entre todas las funciones matemáticas que podrían representar la relación entre los datos disponibles, se elige la más adecuada. Esta elección puede ser fruto de la intuición, como en el caso que acabamos de analizar, o puede derivarse de una demostración matemática rigurosa verificada bajo ciertas hipótesis.
Por ejemplo, la relación que nos permite calcular el precio de un bono a partir de su rendimiento se basa en principios rigurosos y bien conocidos de las matemáticas financieras, por lo que no tendría sentido construir un algoritmo que la aprenda directamente de datos empíricos o a través de la intuición de un modelo representativo deducido de ellos.
Una vez elegida la relación entre la puntuación y el PIB, deben establecerse los valores más adecuados para theta0 (la constante del modelo lineal) y theta1 (la pendiente del modelo lineal), es decir, aquellos que mejor representen la tendencia presente en los datos.
Para obtener valores óptimos para los parámetros del modelo, es necesario especificar una medida de rendimiento. Normalmente, se puede definir una función de utilidad ( también llamada función de aptitud ) que mida la calidad del modelo, o una función de coste que mida su inadecuación.
Para un problema de regresión lineal, como el que se presenta, se suele utilizar una función de coste que mide la distancia entre las predicciones teóricas proporcionadas por el modelo lineal y las que realmente se produjeron en los datos utilizados para entrenar el modelo: el objetivo es minimizar esta distancia.
En este punto, entra en juego el proceso de aprendizaje: se pasan los datos de entrenamiento y se encuentran los valores de los parámetros más representativos, es decir, aquellos que mejor generalizan la relación que se supone que existe entre los datos.
Cabe destacar que, en el caso de la regresión lineal, existen fórmulas analíticas que nos permiten hallar los valores de theta : se trata, de hecho, de un método de mínimos cuadrados ordinarios (OLS).
En el caso de modelos no lineales, se utiliza un procedimiento numérico para resolver el problema de entrenamiento del modelo.
Una vez finalizada la fase de entrenamiento, se pueden realizar predicciones utilizando el modelo calibrado.
Por ejemplo, supongamos que existe un país cuyo PIB se conoce, pero cuya puntuación no ha sido calculada por la OCDE.
Podemos usar la relación lineal Puntuación = theta0 + theta1*PIB , reemplazando el valor de la variable independiente (Producto Interno Bruto) con el valor conocido del país, usar el theta estimado y obtener como resultado (es decir, como predicción) el valor de la variable dependiente, es decir, la puntuación interpretada por nuestro modelo.
En conclusión, se puede observar que el enfoque más común utilizado por la econometría tradicional es el enfoque basado en modelos, en el que, una vez elegida la relación existente entre los datos, se realiza la mejor estimación para determinar los coeficientes de ese modelo.
El aprendizaje basado en instancias , que no presupone a priori la forma funcional a la que necesariamente debe adaptarse la relación entre los datos, ha recibido especial atención con la llegada de nuevos paradigmas de aprendizaje automático.
Concluimos afirmando que “no existe tal cosa como un almuerzo gratis”: si bien el aprendizaje basado en instancias ofrece mayor flexibilidad para definir la relación entre los datos, ya que no es necesario especificarla a priori, es importante destacar que los modelos con este tipo de aprendizaje son más propensos a un posible sobreajuste de los datos y tienden a ser “ cajas negras ”, con la consiguiente falta de explicabilidad de la predicción obtenida.
Artículos Relacionados
-50 𝗴𝗶𝗼𝗿𝗻𝗶. Foro Nacional Contra el Lavado de Dinero 2026
-60 𝗴𝗶𝗼𝗿𝗻𝗶. Foro Nacional Contra el Lavado de Dinero 2026
Informe UIF 2025 – Tercera parte
37.ª edición del Máster en Lucha contra el Blanqueo de Capitales y la Financiación del Terrorismo: Continúan las selecciones
-100 días. La cuenta regresiva para el Foro Nacional contra el Lavado de Dinero de 2026 comienza hoy.
Buscar
Categorías
- Admisiones y cupones (76)
- Inteligencia artificial en la gestión bancaria (6)
- Lucha contra el blanqueo de capitales y cumplimiento normativo (226)
- Banco de Italia – UIF – MEF (40)
- Ciberseguridad (11)
- Economía (13)
- ESB (180)
- GAFI – UE (33)
- Sector del juego (22)
- Noticias (415)
- Escenario internacional (33)
- Testimonios (85)