Ir al contenido

Imágenes

Los tres modelos leen imágenes: fotos, capturas de pantalla, boletas, gráficos o texto escrito a mano. Se mandan como una parte del mensaje, junto al texto.

{
"model": "aguila",
"messages": [{
"role": "user",
"content": [
{ "type": "text", "text": "¿Cuál es el total de esta boleta?" },
{ "type": "image_url", "image_url": { "url": "data:image/jpeg;base64,/9j/4AAQ..." } }
]
}]
}
import base64
with open("boleta.jpg", "rb") as f:
b64 = base64.b64encode(f.read()).decode()
respuesta = client.chat.completions.create(
model="aguila",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "¿Cuál es el total de esta boleta?"},
{"type": "image_url", "image_url": {"url": f"data:image/jpeg;base64,{b64}"}},
],
}],
)
  • Una imagen consume tokens de entrada; cuanto más grande, más tokens. Para leer una boleta no hace falta una foto de 12 megapíxeles.
  • Si la imagen tiene texto chico, que se lea bien: una foto borrosa da peores respuestas.