Clasificación MDSW con IA generativa: FDA frente a la Regla 11 del MDR

La incorporación de inteligencia artificial generativa a un Medical Device Software (MDSW) no modifica, por sí misma, su clasificación de acuerdo al MDR.

Un software no pasa a clase IIb o III simplemente porque utilice un LLM, genere lenguaje natural o incorpore un modelo fundacional. La clasificación continúa dependiendo fundamentalmente de su finalidad prevista y de las consecuencias potenciales que puede tener la información proporcionada por el software.

Sin embargo, la IA generativa introduce una variable que no resulta evidente en el software convencional: un mismo sistema puede proporcionar información, recomendar una actuación o incluso desencadenar una acción dependiendo de cómo haya sido diseñado, de cómo haya evolucionado y de cómo interactúe con el usuario.

El reciente documento de discusión publicado por FDA sobre productos sanitarios con IA generativa resulta especialmente interesante porque aborda directamente esta cuestión mediante un modelo basado en dos dimensiones:

  • qué hace realmente el sistema y
  • qué consecuencias podría suponer confiar en un output incorrecto, dicho de otra forma, que potencial impacto tiene en el proceso clínico de acuerdo con su finalidad prevista.

El planteamiento recuerda en algunos aspectos a la lógica de la Regla 11 del MDR, pero, aunque similar, no es exactamente equivalente.

La Regla 11 del MDR clasifica el software según el impacto de sus decisiones

La Regla 11 del Anexo VIII establece que el software destinado a proporcionar información utilizada para tomar decisiones diagnósticas o terapéuticas se clasifica inicialmente como clase IIa.

La clasificación aumenta a clase IIb cuando esas decisiones pueden provocar un deterioro grave del estado de salud o una intervención quirúrgica, y a clase III cuando pueden provocar la muerte o un deterioro irreversible del estado de salud.

La revisión 1 de MDCG 2019-11, de junio de 2025, desarrolla esta interpretación y relaciona expresamente la Regla 11 con dos elementos procedentes del modelo IMDRF:

  • la importancia de la información proporcionada por el software para la decisión sanitaria y
  • la situación clínica o condición del paciente.

Esto resulta especialmente importante. Se trata de aspecto que alinean el criterio con la normativa y, además, introduce nuevas perpestivas necesarias.

Pero adicionalmente, todavía nos llegan consultas relacionadas con si la clasificación se relaciona con si el software utiliza, o no, inteligencia artificial.

La pregunta correcta, y necesaria, sería:

“¿Qué función médica realiza la información proporcionada por el software y qué puede ocurrir si esa información es incorrecta?”

Esta lógica está directamente relacionada con la incursión de la IA generativa en el proceso; pero se trata de una dimensión que, quizás, todavía no ha sido totalmente abordado por la regulación. Al menos, quizás no con la profundidad necesaria.

FDA introduce una segunda dimensión: cuánto dirige o ejecuta la acción

FDA propone en su discussion paper de agosto de 2026 un marco conceptual de dos ejes para analizar el riesgo de funciones basadas en IA generativa.

El primer eje analiza la actividad realizada por la función y plantea una progresión:

  • información no directiva
  • información que dirige una acción
  • acción bajo supervisión profesional
  • acción completamente autónoma.

El segundo analiza las consecuencias de confiar en un output incorrecto, desde consecuencias limitadas hasta graves. El riesgo aumenta a medida que crecen simultáneamente autonomía y consecuencias.

Conviene recordar que FDA no está proponiendo con ello una nueva clasificación reglamentaria. No es el objetivo, menos ahondar en el criterio de clasificación en Europa. El documento es únicamente un discussion paper, no una guía ni una propuesta regulatoria definitiva.

Pero conceptual y estratégicamente plantea una cuestión muy relevante para Europa. ¿En qué enfoque se debe incorporar la autonomía del software en relación con su propia finalidad prevista?.

Un output informativo puede convertirse en una recomendación clínica

En software tradicional suele resultar relativamente sencillo determinar qué información proporciona una función. Con IA generativa esa frontera podría ser mucho menos clara.

Consideremos cuatro posibles outputs ante la misma situación clínica:

  • “La hipertensión puede requerir modificaciones del tratamiento.”
  • “En pacientes con características similares suele considerarse un incremento de dosis.”
  • “Recomiendo incrementar la dosis.”
  • “Incrementar la dosis de 10 mg a 20 mg diarios.”

La información clínica subyacente puede ser muy similar, pero la capacidad del sistema para dirigir la conducta del usuario cambia considerablemente.

FDA utiliza precisamente esta progresión para señalar que la diferencia entre información non-directive y action-directing probablemente deba entenderse como un continuo. La directividad dependería del contenido y del contexto del output, y no simplemente de utilizar expresiones como “recomiendo” o “considere”.

Para un fabricante europeo esta reflexión es relevante aunque el marco FDA no sea aplicable.

La Regla 11 habla de información utilizada para tomar decisiones diagnósticas o terapéuticas. Por tanto, la finalidad prevista y la función realmente implementada deben definir con suficiente precisión hasta dónde llega esa influencia.

La supervisión médica no reduce automáticamente la clasificación

Existe un enfoque frecuente cuando analizamos software clínico: considerar que la presencia de un médico reduce necesariamente el riesgo porque la decisión final corresponde al profesional. No es así. Aunque personalmente, podría entender (y compartir) ciertos enfoques de este tipo, la regulación quiere determinar de la conformidad del outcome; en relación con una posible influencia negativa sobre el médico.

MDCG 2019-11 Rev.1 incluye ejemplos que muestran precisamente la importancia de analizar qué papel desempeña el output. Una aplicación que analiza el ritmo cardíaco, detecta anomalías e informa al médico puede ser clase IIb cuando esa información pretende guiar el diagnóstico. También sitúa en IIb un MDSW destinado a realizar un scoring diagnóstico de depresión en una situación clínica considerada seria.

Por tanto:

“La decisión final la toma el médico” no es por sí mismo un argumento suficiente para reducir la clasificación.

Hay que determinar cuánto condiciona el software esa decisión y cuáles serían las consecuencias razonablemente previsibles de una información incorrecta.

FDA lleva esta cuestión un paso más allá al preguntarse incluso si debe diferenciarse entre outputs destinados a especialistas y outputs destinados a profesionales sanitarios generalistas. Personalmente, comparto enormemente este enfoque porque creo que un error, podría ser sensiblemente más crítico.

Un profesional especializado podría disponer de mayor capacidad para contextualizar o detectar un output incorrecto. Un usuario sin ese conocimiento específico puede confiar en mayor medida en la recomendación proporcionada por la IA.

La cuestión tiene implicaciones directas sobre finalidad prevista, usuarios previstos, usabilidad, gestión de riesgos y evidencia clínica.

La IA generativa introduce variabilidad, pero la variabilidad no determina la clase

Otro error sería asociar directamente la naturaleza probabilística de una IA generativa con una clasificación superior.

Que un sistema pueda producir outputs diferentes ante inputs similares constituye un problema importante de validación, robustez y gestión de riesgos, pero, en este momento, no es por sí mismo un criterio de clasificación establecido por la Regla 11.

FDA identifica precisamente como características particulares de GenAI la posibilidad de aceptar inputs abiertos, ejecutar múltiples subtareas y generar outputs variables ante entradas similares. También identifica riesgos derivados de alucinaciones, límites imprecisos de la finalidad prevista y degradación del funcionamiento.

Estos factores pueden incrementar la probabilidad de un output incorrecto y complicar su control. De ello, aparecen dos preguntas necesarias:

¿Cuál es la probabilidad de que el sistema produzca un resultado incorrecto?

y

¿Qué consecuencias podría tener utilizar ese resultado?

La primera pertenece principalmente a la validación y gestión del riesgo. La segunda tiene una relación mucho más directa con la clasificación bajo la Regla 11.

La finalidad prevista sigue siendo determinante para clasificar MDSW con IA generativa

El Anexo VIII del MDR establece expresamente que la aplicación de las reglas de clasificación se rige por la finalidad prevista del producto.

En IA generativa esto adquiere especial importancia. No basta con definir una finalidad general como “ayudar al profesional sanitario en la toma de decisiones”.

Será necesario establecer qué información recibe el sistema, qué outputs puede generar, qué decisiones pretende soportar, quién los recibe, en qué contexto clínico se utilizan y cuáles son los límites funcionales del producto.

Un cambio aparentemente pequeño puede modificar sustancialmente el análisis. Es más, lo cambia sensiblemente si analizamos el potencial impacto en el proceso clínico.

No es equivalente un sistema que resume información clínica, otro que identifica información relevante para el diagnóstico, otro que propone un diagnóstico diferencial y otro que selecciona o recomienda una actuación terapéutica individualizada.

La tecnología podría ser exactamente la misma, pero la función médica y el riesgo no lo son.

Por eso resulta especialmente útil recordar una idea que ya analizamos al estudiar cuándo una IA generativa puede considerarse MDSW:

capacidad del modelo ≠ funcionamiento del producto MDSW.

Y podemos añadir ahora una segunda:

capacidad tecnológica ≠ clasificación regulatoria.

FDA y MDR parten de una lógica de riesgo sorprendentemente próxima

Aunque sus estructuras regulatorias son diferentes, existe una similitud conceptual que resulta interesante.

MDCG 2019-11 explica que la Regla 11 se desarrolló teniendo en cuenta el marco internacional IMDRF y relaciona el riesgo con la importancia de la información proporcionada y con la situación clínica del paciente.

FDA propone ahora analizar GenAI atendiendo a actividad/autonomía y consecuencias del output incorrecto.

No son modelos intercambiables. Pero ambos obligan a mirar más allá de la tecnología.

Y aquí podría estar una de las principales conclusiones para los fabricantes europeos.

La aparición de la IA generativa no demuestra que la Regla 11 haya quedado obsoleta, pero resultará extremadamente complicda de aplicar. Sus principios siguen permitiendo clasificar MDSW atendiendo a finalidad prevista, función de la información y consecuencias clínicas.

Lo que la IA generativa hace más difícil es describir con precisión qué papel desempeña realmente el output dentro de la decisión clínica y cuál es el impacto real en el proceso clínico.

Si un sistema puede conversar, contextualizar información, personalizar respuestas, formular recomendaciones y modificar el grado de directividad de sus outputs, definir correctamente sus límites funcionales deja de ser únicamente una cuestión de diseño.

Se convierte en una cuestión directamente regulatoria. Ahora mismo, antes de preguntarnos si una IA médica debe clasificarse como IIa, IIb o III, necesitamos poder responder con precisión a una pregunta aparentemente mucho más sencilla:

¿qué decisiones clínicas puede llegar a condicionar realmente este software?

Fernando Atienza
Política de privacidad

Esta web utiliza cookies para que podamos ofrecerte la mejor experiencia de usuario posible. La información de las cookies se almacena en tu navegador y realiza funciones tales como reconocerte cuando vuelves a nuestra web o ayudar a nuestro equipo a comprender qué secciones de la web encuentras más interesantes y útiles.