{"ok":true,"article":{"slug":"from-token-probabilities-to-calibrated-confidence-an-empirical-study-of-mathemat-2c905e10","title":"From token probabilities to calibrated confidence: An empirical study of mathematical question answering","url":"https://arxiv.org/abs/2608.07827","canonical":"https://www.aimode.news/article/from-token-probabilities-to-calibrated-confidence-an-empirical-study-of-mathemat-2c905e10","sourceName":"arXiv cs.LG","summary":"arXiv:2608.07827v1 Announce Type: new Abstract: Confidence estimation for large language models (LLMs) aims to estimate the probability that a generated answer is correct, while calibration aligns these estimates with empirical accuracy. Prior work has shown that token probabilities are often overconfident, we investi…","category":"AI","image":"https://static.arxiv.org/icons/twitter/arxiv-logo-twitter-square.png","lang":"en","publishedAt":"2026-08-11T04:00:00+00:00","createdAt":"2026-08-11T19:09:30.456448+00:00"}}