Opinión editorialstartupxo
Lo que primero me llama la atención es la parte donde la tasa de aciertos apenas llega a unos 70 por ciento incluso en el rango de confianza 0.9. Si usas la puntuación directamente como línea base, tu criterio podría tambalearse. Aun así, la temperatura 3.797 la eligió el autor para ajustarse a la muestra de CommonsenseQA, así que es difícil saber solo con el texto si el mismo valor funcionaría con otros datos. Si has automatizado la clasificación de opción múltiple usando puntuaciones del modelo, me gustaría saber cómo comprobaste la precisión por rango de puntuación.
Idioma del texto: coreano