Imágenes
Los tres modelos leen imágenes: fotos, capturas de pantalla, boletas, gráficos o texto escrito a mano. Se mandan como una parte del mensaje, junto al texto.
{ "model": "aguila", "messages": [{ "role": "user", "content": [ { "type": "text", "text": "¿Cuál es el total de esta boleta?" }, { "type": "image_url", "image_url": { "url": "data:image/jpeg;base64,/9j/4AAQ..." } } ] }]}En Python, desde un archivo
Sección titulada «En Python, desde un archivo»import base64
with open("boleta.jpg", "rb") as f: b64 = base64.b64encode(f.read()).decode()
respuesta = client.chat.completions.create( model="aguila", messages=[{ "role": "user", "content": [ {"type": "text", "text": "¿Cuál es el total de esta boleta?"}, {"type": "image_url", "image_url": {"url": f"data:image/jpeg;base64,{b64}"}}, ], }],)Consejos
Sección titulada «Consejos»- Una imagen consume tokens de entrada; cuanto más grande, más tokens. Para leer una boleta no hace falta una foto de 12 megapíxeles.
- Si la imagen tiene texto chico, que se lea bien: una foto borrosa da peores respuestas.
