Todos los asistentes de IA principales de 2026 —ChatGPT, Claude, Gemini y Copilot— pueden analizar imágenes. Subes una foto, una captura de pantalla, un gráfico, un documento escaneado o un texto manuscrito y formulas una pregunta. El modelo analiza el contenido y responde.
La función tiene mucha más capacidad de la que imagina quien empieza. También puede eludir tus hábitos de privacidad porque subir una foto parece distinto de pegar texto. Este artículo aborda ambos aspectos: los usos en los que una imagen cambia realmente el flujo de trabajo y la breve comprobación que debes hacer antes de pulsar Enviar.
Cómo subir una imagen
En cada asistente de IA importante, el botón de subida es el icono de clip o ”+” cerca del cuadro de texto. Las aplicaciones móviles te permiten tomar una foto directamente. Puedes pegar una imagen desde tu portapapeles en el escritorio. Los formatos compatibles son JPEG, PNG, WEBP y normalmente HEIC y PDF. La mayoría de las aplicaciones también aceptan PDFs de varias páginas y capturas de pantalla de tu teléfono.
Un detalle útil: puedes subir una imagen y escribir un prompt al mismo tiempo. El modelo utiliza ambos. Escribir solo «¿qué es esto?» funciona, pero «¿cuál es el tercer punto de esta diapositiva?» producirá una respuesta mucho mejor.
Los casos de uso que valen la pena
Algunos escenarios de subida de imágenes son tan superiores a la alternativa que, una vez que los pruebas, no regresas.
Interpretar gráficos de documentos largos. Los informes anuales, artículos de investigación, estudios de mercado y presentaciones contienen gráficos que exigen un esfuerzo real de interpretación. Recorta el gráfico, sube la imagen y pregunta: «¿Qué muestra, cuál es el dato más sorprendente y qué implica para alguien que trabaja como [tu puesto]?». El modelo sabe extraer el resumen y sus implicaciones.
Identificar objetos. Una planta del jardín, un dispositivo sobre una mesa, un ingrediente desconocido, un pez en el mercado o la marca y el modelo de un electrodoméstico antiguo. Sube la imagen y pregunta. El modelo ofrecerá una estimación y, si se lo pides, posibles alternativas.
Leer notas manuscritas. Notas de una reunión en un pizarrón. Una carta escrita a mano. Una receta garabateada en una tarjeta. Fotografías de un cuaderno. Los modelos modernos son sorprendentemente buenos para leer escritura a mano desordenada, y la limpieza (“convierte esto en un conjunto estructurado de puntos de acción”) está a un solo prompt de distancia.
Decodificar capturas de pantalla. Un mensaje de error confuso. Una hoja de cálculo que no se comporta. Un fragmento de código en una presentación. Un gráfico en un hilo de Slack que no puedes copiar fácilmente. Captura la pantalla, sube la imagen, pregunta. Más rápido que copiar y reformatear.
Leer recibos y facturas. Resulta especialmente útil en los viajes de trabajo. Fotografía el documento y pide al modelo que extraiga la fecha, el proveedor, el total, la moneda y la categoría en un formato limpio. Después podrás pegar el resultado en tu herramienta de gastos. Procesa por lotes una pila de recibos.
Comentarios sobre estilo y diseño. Sube una diapositiva, un currículum, un cartel o la captura de una página de destino y pregunta: «¿Qué verá primero un lector, qué podría eliminarse y qué falta en la jerarquía visual?». Es uno de los usos más valiosos para quien trabaja con documentos y presentaciones.
Verificar traducciones. Una foto de una señal o menú en un país extranjero. Sube la imagen, pide la traducción y cualquier contexto cultural. Más rápido y confiable que un traductor de teléfono para cualquier cosa más allá de unas pocas palabras.
Cocinar con lo que tienes. Abre la nevera, fotografía el contenido, sube la imagen y pregunta: «¿Qué puedo preparar para cenar en 30 minutos con lo que ves?». El modelo suele resolver bien esta tarea.
Una ventaja subestimada específica: tablas y listas en capturas de pantalla
Si alguna vez has tenido que extraer datos de una tabla incrustada en una imagen o un PDF que no permite copiar, sabes lo tedioso que resulta. La IA actual simplifica mucho la tarea:
Aquí hay una captura de pantalla de una tabla. Extrae los datos en un CSV limpio. La primera columna es la fila de encabezado. Marca cualquier valor del que no estés seguro con
[?].
Después puedes pegar el CSV en Excel o Google Sheets. En una tabla compleja, el ahorro de tiempo es considerable. La instrucción «marca los valores inciertos» importa: sin ella, los errores de reconocimiento de texto pueden pasar inadvertidos.
Lo que la subida de imágenes no hace bien
Esta es una lista breve y sincera de las tareas en las que el modelo resulta poco fiable:
Extracción precisa de texto de imágenes de baja calidad. Fotos ligeramente borrosas, documentos con ángulos extraños, texto muy pequeño. El modelo hará un intento confiado, pero la precisión disminuye. Siempre verifica si la precisión importa.
Identificar individuos específicos con nombre. La mayoría de los modelos no identificarán a una persona específica en una foto, tanto por razones de precisión como de privacidad. Describirán lo que ven.
Contar y medir. «¿Cuántas personas aparecen en esta foto?» o «¿Qué altura tiene este objeto?». Los modelos fallan sorprendentemente al contar y medir con precisión; ofrecerán una estimación plausible. Verifícala si la respuesta importa.
Leer escáneres médicos, radiografías, resonancias magnéticas u otras imágenes clínicas. Los modelos pueden describir rasgos generales, pero no deben utilizarse para diagnosticar. Consulta siempre a un profesional sanitario.
Cualquier cosa temporal en una foto. Una captura de la gráfica de acciones de ayer, una captura de una partida en vivo, el clima actual — el modelo puede leer lo que está en la imagen, pero no sabe si es actual.
La lista de verificación de privacidad de treinta segundos
Aquí la subida de imágenes difiere del texto. Alguien que nunca pegaría datos de clientes en ChatGPT puede subir sin pensarlo una captura de esos mismos datos porque pulsar el botón de la cámara parece informal. Antes de subir nada, responde cinco preguntas:
- ¿La imagen contiene datos personales? Nombres, rostros —especialmente de menores—, domicilios, números de identificación, matrículas, cuentas bancarias, páginas de pasaporte o datos médicos. Si es así, recórtalos antes de subirla o no la subas.
- ¿Contiene información sujeta a la política de datos de tu empresa? Datos de clientes, documentos internos confidenciales, código fuente de repositorios corporativos, salarios o cualquier información cubierta por un acuerdo de confidencialidad. Si es así, utiliza la IA autorizada por la empresa —Microsoft Copilot empresarial, ChatGPT Enterprise, etc.—, no tu cuenta personal.
- ¿Está activada la opción «Mejorar el modelo para todos»? En ChatGPT se encuentra en Configuración → Controles de datos. Desactívala como opción predeterminada si vas a subir algo que no querrías ver expuesto públicamente. Otras herramientas ofrecen ajustes similares.
- ¿Podría la imagen conservarse o filtrarse desde los registros del servicio? Probablemente no —los principales proveedores cuentan con buenas medidas de seguridad—, pero no puedes garantizarlo. Trátala como un correo electrónico y asume que podría conservarse indefinidamente.
- ¿Hay una forma más sencilla de extraer solo la parte que necesitas? A menudo, la respuesta es sí. Una foto de una sola línea de un contrato es mucho mejor que una foto de toda la página.
Regla práctica: si no pegarías como texto en el chat el contenido de la imagen, tampoco subas la imagen.
Prueba esta semana
Tres usos simples para que la subida de imágenes se sienta reflejo:
- Fotografía un gráfico de cualquier documento que estés leyendo esta semana y pregunta al modelo qué implica.
- Toma una captura de un recibo y pide un extracto estructurado de gastos.
- Toma una captura de una diapositiva de la que no estás seguro y pide al modelo una ronda de feedback estructural.
Después de estas tres pruebas empezarás a detectar oportunidades para usar imágenes por todas partes. Mantén presente la comprobación de privacidad: requiere treinta segundos y evita una clase de problema que no quieres afrontar.



