{"as_of":"2026-08-12T13:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f9b9e92a5486f5b4ccbc32df70c3d5a08c505ec6193325380afafedcb473c60d","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T19:01:29.631887Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09351/citation-record","integrity":"/paper/2608.09351/integrity","json":"/paper/2608.09351/citation-record.json","paper":"/paper/2608.09351"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.02733","last_updated":"2025-04-03T16:17:56Z","snapshot_observed_at":"2026-08-07T16:10:58.601386Z","submitted_at":"2025-04-03T16:17:56Z","title":"Enhancing LLM Robustness to Perturbed Instructions: An Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02733","snapshot_observed_at":"2026-08-11T19:01:29.532259Z","title":"Enhancing llm robustness to perturbed instructions: An empirical study.arXiv preprint arXiv:2504.02733,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.532259Z"},"links":{"cited_paper":"/paper/2504.02733","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:92c785f6a8364608888b2749ef27e7234dda5a8176a0afa83b3e1602fc47db35","observation_id":"a7faa10d-4099-41b5-a650-21c53b820358","resolution":{"observed_at":"2026-08-11T19:01:29.532259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07279","last_updated":"2025-03-25T03:36:21Z","snapshot_observed_at":"2026-08-12T08:01:13.819457Z","submitted_at":"2024-11-11T18:59:45Z","title":"The Surprising Effectiveness of Test-Time Training for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07279","snapshot_observed_at":"2026-08-11T19:01:29.539084Z","title":"The surprising effectiveness of test-time training for few-shot learning.arXiv preprint arXiv:2411.07279,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.539084Z"},"links":{"cited_paper":"/paper/2411.07279","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:432cf7ce6499652797a56d97710cd5416767691235f7cfd234a7b1cc58fe7b10","observation_id":"267c094b-32aa-4078-97f7-149f5ed65537","resolution":{"observed_at":"2026-08-11T19:01:29.539084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18845","last_updated":"2025-01-31T01:50:49Z","snapshot_observed_at":"2026-08-10T11:50:24.331905Z","submitted_at":"2025-01-31T01:50:49Z","title":"Text Data Augmentation for Large Language Models: A Comprehensive Survey of Methods, Challenges, and Opportunities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18845","snapshot_observed_at":"2026-08-11T19:01:29.545090Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.545090Z"},"links":{"cited_paper":"/paper/2501.18845","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:6506701338d044951af96f7441599037ca2f5decc68749956ffe9ee3fbdc3393","observation_id":"274cfb02-528f-42a0-9697-9dcd0ab32c86","resolution":{"observed_at":"2026-08-11T19:01:29.545090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02111","last_updated":"2025-04-02T20:18:50Z","snapshot_observed_at":"2026-08-11T02:38:49.354667Z","submitted_at":"2025-04-02T20:18:50Z","title":"Exploring LLM Reasoning Through Controlled Prompt Variations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02111","snapshot_observed_at":"2026-08-11T19:01:29.548200Z","title":"Exploring llm reasoning through controlled prompt variations.arXiv preprint arXiv:2504.02111,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.548200Z"},"links":{"cited_paper":"/paper/2504.02111","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:f502210c6e2e09bef165a05c907f8d6d329efe80495a5d7c96de6473f3780138","observation_id":"9e6fa001-a216-4e73-9165-179998869704","resolution":{"observed_at":"2026-08-11T19:01:29.548200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05128","last_updated":"2023-10-05T09:12:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-11T10:43:43Z","title":"Teaching Large Language Models to Self-Debug","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05128","snapshot_observed_at":"2026-08-11T19:01:29.551448Z","title":"Teaching large language models to self-debug.arXiv preprint arXiv:2304.05128,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.551448Z"},"links":{"cited_paper":"/paper/2304.05128","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:dd15d132ab45d78b75de4412c81399f02e8f651024f3aa98a98d4fe543f2037f","observation_id":"e28a2820-d83a-4870-a3e4-ad5d68cb7093","resolution":{"observed_at":"2026-08-11T19:01:29.551448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-11T19:01:29.556706Z","title":"No language left behind: Scaling human-centered machine translation.arXiv preprint arXiv:2207.04672,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.556706Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:561d2a6d8fb31830888a1bf0bca2f61fe0c23db38276793e8a6230464c6b1b7d","observation_id":"dba996a4-ac77-43ba-b281-90b9f444d1e3","resolution":{"observed_at":"2026-08-11T19:01:29.556706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18330","last_updated":"2024-11-02T15:29:07Z","snapshot_observed_at":"2026-08-12T09:48:53.554899Z","submitted_at":"2024-05-28T16:24:47Z","title":"Frustratingly Easy Test-Time Adaptation of Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18330","snapshot_observed_at":"2026-08-11T19:01:29.562315Z","title":"Frustratingly easy test-time adaptation of vision-language models.arXiv preprint arXiv:2405.18330,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.562315Z"},"links":{"cited_paper":"/paper/2405.18330","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:59ab2068b0b278a67fa408060e36e4896848ecc7e07542c20df4629e88456f38","observation_id":"138c76ef-b0c1-414d-9ba9-ae9aaba98965","resolution":{"observed_at":"2026-08-11T19:01:29.562315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18299","last_updated":"2024-12-24T09:06:58Z","snapshot_observed_at":"2026-08-11T04:47:33.180974Z","submitted_at":"2024-12-24T09:06:58Z","title":"M-Ped: Multi-Prompt Ensemble Decoding for Large Language Models","version":1},"cited_work":{"arxiv_id":"2412.18299","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.18299","snapshot_observed_at":"2026-08-11T19:02:25.240401Z","title":"M-Ped: Multi-Prompt Ensemble Decoding for Large Language Models","venue":"cs.CL","work_id":"e104b51c-f410-4a4d-b3de-611dc8d015de","year":2024},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.565203Z"},"links":{"cited_paper":"/paper/2412.18299","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:85d1a9b20a5ecca51622cc8faa108569b284535906cd48de9d4072c3688d4010","observation_id":"1d6734f8-74a2-4378-b1f6-cc53c7332200","resolution":{"observed_at":"2026-08-11T19:02:25.243674Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-11T19:01:29.568253Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.568253Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:88acb2d410832e27b8fd3e312940fd14715efea5336df82fc2172a718fb70b8d","observation_id":"a6e6da89-ec2d-4ea2-8465-ff9cf098849e","resolution":{"observed_at":"2026-08-11T19:01:29.568253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08020","last_updated":"2025-02-08T19:39:09Z","snapshot_observed_at":"2026-08-09T20:46:54.394199Z","submitted_at":"2024-10-10T15:17:49Z","title":"Efficiently Learning at Test-Time: Active Fine-Tuning of LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08020","snapshot_observed_at":"2026-08-11T19:01:29.573473Z","title":"Efficiently learning at test-time: Active fine-tuning of llms.arXiv preprint arXiv:2410.08020,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.573473Z"},"links":{"cited_paper":"/paper/2410.08020","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:abb95928443f1d9f8ee2f8d4cfe697441b09d6dd46333612344367eee2c626cc","observation_id":"3b7c528a-9b4b-4149-94d9-e81195fc1496","resolution":{"observed_at":"2026-08-11T19:01:29.573473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:02:40.434384Z","title":"Calibrating language models via augmented prompt ensembles","venue":null,"work_id":"6c764ad4-d85e-4991-aba3-a79e093702d0","year":2023},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.576659Z"},"links":{"citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:df1d1d4676c910b8867a4bf564f7803452273225a9d6c41bde119bef9469e947","observation_id":"b3c73951-a3d0-45ea-9c3a-2043d58f2330","resolution":{"observed_at":"2026-08-11T19:02:40.437350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17121","last_updated":"2023-10-26T03:41:32Z","snapshot_observed_at":"2026-07-06T16:38:40.508335Z","submitted_at":"2023-10-26T03:41:32Z","title":"Test-time Augmentation for Factual Probing","version":1},"cited_work":{"arxiv_id":"2310.17121","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.17121","snapshot_observed_at":"2026-08-11T19:02:10.180278Z","title":"Test-time Augmentation for Factual Probing","venue":"cs.CL","work_id":"7c25af55-fb02-4087-be90-bb2bd076f228","year":2023},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.579337Z"},"links":{"cited_paper":"/paper/2310.17121","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:30b5da5edacd3c95ed5bdc36e5d0343a315c6d44a86bae771a99db772bbafbb7","observation_id":"cff92cfd-bdf2-47bf-a7a1-fc5c5e406a62","resolution":{"observed_at":"2026-08-11T19:02:10.183656Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.13607","last_updated":"2022-06-27T19:57:27Z","snapshot_observed_at":"2026-08-05T07:57:32.024865Z","submitted_at":"2022-06-27T19:57:27Z","title":"Improved Text Classification via Test-Time Augmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.13607","snapshot_observed_at":"2026-08-11T19:01:29.582126Z","title":"Improved text classification via test-time augmentation.arXiv preprint arXiv:2206.13607,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.582126Z"},"links":{"cited_paper":"/paper/2206.13607","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:0fb466858dd949fac9cb24e8fe580bc40bf663e8d8886f6e325934e8c9d8ef6d","observation_id":"4bd67d26-faff-47b6-bb9f-2fcad9165c9d","resolution":{"observed_at":"2026-08-11T19:01:29.582126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-12T03:16:23.683572Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-11T19:01:29.584800Z","title":"Reft: Reasoning with reinforced fine-tuning.arXiv preprint arXiv:2401.08967,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.584800Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:ea799864605eea3532259566ecf4048441d98cd8f4b66895663a0459db99cf7b","observation_id":"c6f71437-e619-4f1d-afcf-889046fc80fb","resolution":{"observed_at":"2026-08-11T19:01:29.584800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-11T19:01:29.590449Z","title":"Long Phan et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.590449Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:a61ca68de0a765a008eab4184ae558885198a6e021a99b1a3aa0319e9239305f","observation_id":"1bbf7138-9f82-4521-ba43-69ffb2f84fcf","resolution":{"observed_at":"2026-08-11T19:01:29.590449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05970","last_updated":"2023-04-12T16:47:15Z","snapshot_observed_at":"2026-08-05T11:48:57.735383Z","submitted_at":"2023-04-12T16:47:15Z","title":"Boosted Prompt Ensembles for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05970","snapshot_observed_at":"2026-08-11T19:01:29.593127Z","title":"Zhang, Andrew Wang, and Jimmy Ba","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.593127Z"},"links":{"cited_paper":"/paper/2304.05970","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:bb633327adf649bf43be0865d7bc09d3befab4e0ff02aa0ea3e53af934ecee61","observation_id":"71adee13-e605-4423-b1c8-3a5ba9bb01dc","resolution":{"observed_at":"2026-08-11T19:01:29.593127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11383","last_updated":"2025-08-15T10:32:50Z","snapshot_observed_at":"2026-08-05T19:59:02.642227Z","submitted_at":"2025-08-15T10:32:50Z","title":"When Punctuation Matters: A Large-Scale Comparison of Prompt Robustness Methods for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.11383","snapshot_observed_at":"2026-08-11T19:01:29.595863Z","title":"When punctuation matters: A large-scale comparison of prompt robustness methods for llms.arXiv preprint arXiv:2508.11383,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.595863Z"},"links":{"cited_paper":"/paper/2508.11383","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:221f54481c52ab2d799c0608fe3bae65624ae3a6e66ed2824633c36138af5286","observation_id":"925c9d0a-1c63-4e28-9703-13a0e88c3936","resolution":{"observed_at":"2026-08-11T19:01:29.595863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-02T06:08:09.777151Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08146","snapshot_observed_at":"2026-08-11T19:01:29.598569Z","title":"Rewarding progress: Scaling automated process verifiers for llm reasoning.arXiv preprint arXiv:2410.08146,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.598569Z"},"links":{"cited_paper":"/paper/2410.08146","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:2b22004c9f2fec8a503b0861a1dfc915783b08bafd30ae01559d282e1bc3f321","observation_id":"7e0924ec-8f7b-4c4e-99a4-539415e9c089","resolution":{"observed_at":"2026-08-11T19:01:29.598569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.11156","last_updated":"2021-10-11T19:58:48Z","snapshot_observed_at":"2026-08-08T00:09:48.030853Z","submitted_at":"2020-11-23T00:46:00Z","title":"Better Aggregation in Test-Time Augmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.11156","snapshot_observed_at":"2026-08-11T19:01:29.601164Z","title":"Better aggregation in test-time augmentation.arXiv preprint arXiv:2011.11156,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.601164Z"},"links":{"cited_paper":"/paper/2011.11156","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:4b1b8b8354fa1764664f8e8e2ea3e2bf0d0fca9014f0049c7a35049737dbfe77","observation_id":"9ccfa0ef-9c32-4dcb-bb91-eb9c8f7731fa","resolution":{"observed_at":"2026-08-11T19:01:29.601164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08115","last_updated":"2024-08-03T21:25:31Z","snapshot_observed_at":"2026-08-10T01:47:55.445525Z","submitted_at":"2024-02-12T23:11:01Z","title":"On the Self-Verification Limitations of Large Language Models on Reasoning and Planning Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08115","snapshot_observed_at":"2026-08-11T19:01:29.607177Z","title":"On the self-verification limitations of large language models on reasoning and planning tasks.arXiv preprint arXiv:2402.08115,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.607177Z"},"links":{"cited_paper":"/paper/2402.08115","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:7a742bd01272f3de272671df78bb1f008be0ca7089ba0c44cb579cbb442097b3","observation_id":"f4a00aed-f634-41ce-9bf7-0cc24d88e6c7","resolution":{"observed_at":"2026-08-11T19:01:29.607177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:01:29.609878Z","title":"Confidence improves self-consistency in llms.arXiv preprint arXiv:2502.06233,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.609878Z"},"links":{"citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:3548dde9e213b0b4c59af0cc3a77e902fb6b01cd26f7214bfe56ea6a9352ccd4","observation_id":"f8e096ca-cdad-4c11-a066-6d3d0b38de34","resolution":{"observed_at":"2026-08-11T19:01:29.609878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08118","last_updated":"2023-10-12T08:22:37Z","snapshot_observed_at":"2026-08-07T20:55:31.330978Z","submitted_at":"2023-10-12T08:22:37Z","title":"Can Large Language Models Really Improve by Self-critiquing Their Own Plans?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08118","snapshot_observed_at":"2026-08-11T19:01:29.612699Z","title":"Can large language models really improve by self-critiquing their own plans?arXiv preprint arXiv:2310.08118,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.612699Z"},"links":{"cited_paper":"/paper/2310.08118","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:92ac8f0cce461512146113fc46dfc362ca73d921f4dd4968790f45a209c42518","observation_id":"aa0e2dae-a3e0-4897-ad3b-cf91d50542d9","resolution":{"observed_at":"2026-08-11T19:01:29.612699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2406.19898","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:01:55.061293Z","title":"Paraphrase types elicit prompt engineering capabilities.arXiv preprint arXiv:2406.19898,","venue":null,"work_id":"e1e646a9-620a-4903-a4bb-c219b254135b","year":null},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.615330Z"},"links":{"citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:35c72e18d044c9bdcf258629d4f7633a4d7228cb2e9104ffb13789f7978f53c9","observation_id":"5391658d-cc28-48e7-8402-61fa8f74db9d","resolution":{"observed_at":"2026-08-11T19:01:55.066549Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17163","last_updated":"2024-06-24T22:30:26Z","snapshot_observed_at":"2026-07-06T18:36:26.223825Z","submitted_at":"2024-06-24T22:30:26Z","title":"Paraphrase and Aggregate with Large Language Models for Minimizing Intent Classification Errors","version":1},"cited_work":{"arxiv_id":"2406.17163","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.17163","snapshot_observed_at":"2026-08-11T19:01:44.746206Z","title":"Paraphrase and Aggregate with Large Language Models for Minimizing Intent Classification Errors","venue":"cs.CL","work_id":"c7795371-558d-493a-b431-f6a496d90e0e","year":2024},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.617854Z"},"links":{"cited_paper":"/paper/2406.17163","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:7cc68d2c557cf69585a5b4c51360b937a03114461e3ea953423b55516be71ad0","observation_id":"999d48c4-4613-4f7c-8c55-3b4b207a152b","resolution":{"observed_at":"2026-08-11T19:01:44.750369Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17800","last_updated":"2025-02-25T03:03:35Z","snapshot_observed_at":"2026-08-07T17:51:26.966418Z","submitted_at":"2025-02-25T03:03:35Z","title":"Your Language Model May Think Too Rigidly: Achieving Reasoning Consistency with Symmetry-Enhanced Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17800","snapshot_observed_at":"2026-08-11T19:01:29.620769Z","title":"Your language model may think too rigidly: Achieving reasoning consistency with symmetry-enhanced training.arXiv preprint arXiv:2502.17800,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.620769Z"},"links":{"cited_paper":"/paper/2502.17800","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:61de54b83f5707f01860df077a2b78c9c32e9531e4caaacc33cb66406f1a38c4","observation_id":"74699a4a-1fd0-4095-98af-9a2eed0326d4","resolution":{"observed_at":"2026-08-11T19:01:29.620769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-11T19:01:29.623654Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi.arXiv preprint arXiv:2311.16502,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.623654Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:3c8e04b51870dc5c992e5d29ffbffa9ca4220fbccf33d62ab428cb1c38def140","observation_id":"99260707-88f6-4fe3-86fc-3d63e485bc8a","resolution":{"observed_at":"2026-08-11T19:01:29.623654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12033","last_updated":"2023-08-23T09:46:37Z","snapshot_observed_at":"2026-08-11T17:49:27.277882Z","submitted_at":"2023-08-23T09:46:37Z","title":"PREFER: Prompt Ensemble Learning via Feedback-Reflect-Refine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12033","snapshot_observed_at":"2026-08-11T19:01:29.626588Z","title":"PREFER: Prompt ensemble learning via feedback-reflect-refine.arXiv preprint arXiv:2308.12033,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.626588Z"},"links":{"cited_paper":"/paper/2308.12033","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:0f7f7d3c595d46da758655a062b3cafdbc8330bef33db576090324c199e79286","observation_id":"21afcc6d-3ff9-4e5e-a30c-b57482d666d9","resolution":{"observed_at":"2026-08-11T19:01:29.626588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11500","last_updated":"2024-04-17T15:53:49Z","snapshot_observed_at":"2026-08-10T06:39:07.804754Z","submitted_at":"2024-04-17T15:53:49Z","title":"Paraphrase and Solve: Exploring and Exploiting the Impact of Surface Form on Mathematical Reasoning in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11500","snapshot_observed_at":"2026-08-11T19:01:29.629219Z","title":"Paraphrase and solve: Exploring and exploiting the impact of surface form on mathematical reasoning in large language models.arXiv preprint arXiv:2404.11500,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.629219Z"},"links":{"cited_paper":"/paper/2404.11500","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:2858dac6f0a6ea9da4ffe3a10d96f20aa508d5dc6d70b7943ea86adf2e1643c8","observation_id":"40454ea8-570d-4c8b-97ec-ca34c0314d78","resolution":{"observed_at":"2026-08-11T19:01:29.629219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5026.8928","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:01:44.710325Z","title":"output as array","venue":null,"work_id":"15e97c84-d37d-45f3-8e5f-ba4cf357a097","year":2026},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.631887Z"},"links":{"citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:7aa8c0bd7ac8cec924791d8ec5592fb5f656de8b86fcf6542b8defb71141bc51","observation_id":"24f0135a-0377-40f5-bc64-063830293537","resolution":{"observed_at":"2026-08-11T19:01:44.714610Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13069","last_updated":"2024-07-18T00:28:04Z","snapshot_observed_at":"2026-07-06T18:48:08.251086Z","submitted_at":"2024-07-18T00:28:04Z","title":"Dynamic Sentiment Analysis with Local Large Language Models using Majority Voting: A Study on Factors Affecting Restaurant Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13069","snapshot_observed_at":"2026-08-11T19:01:29.587591Z","title":"Dynamic sentiment analysis with local large language models using majority voting: A study on factors affecting restaurant evaluation.arXiv preprint arXiv:2407.13069,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.587591Z"},"links":{"cited_paper":"/paper/2407.13069","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:e33398302980a496dd7ed6246a7471133ba6bf5d2cfb209a5392247f1fc91718","observation_id":"0139a27c-89ff-4c33-9b54-781123c46005","resolution":{"observed_at":"2026-08-11T19:01:29.587591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-11T19:01:29.604113Z","title":"Scaling llm test-time compute opti- mally can be more effective than scaling model parameters.arXiv preprint arXiv:2408.03314,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.604113Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:9f7bdb5ea0cea60e8d100ac4e15dbefeeaa35064849d3ceb8ba6835011a09762","observation_id":"9acfdb9f-c477-417a-b29c-08e840dc63b5","resolution":{"observed_at":"2026-08-11T19:01:29.604113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.10857","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:02:25.222360Z","title":"Mirror-consistency: Harnessing inconsistency in majority voting.arXiv preprint arXiv:2410.10857,","venue":null,"work_id":"457d2d6a-7e1f-4bfa-904a-f29c0377ec3f","year":null},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.570968Z"},"links":{"citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:111d38ac6e385864bf7454296847c52d3793c1a2cf8281168b872a5f14266c25","observation_id":"7c8d72bf-8bd1-451c-bc23-a2fae51aa21b","resolution":{"observed_at":"2026-08-11T19:02:25.226343Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04205","last_updated":"2024-04-18T23:49:56Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T18:43:34Z","title":"Rephrase and Respond: Let Large Language Models Ask Better Questions for Themselves","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04205","snapshot_observed_at":"2026-08-11T19:01:29.559468Z","title":"Rephrase and respond: Let large language models ask better questions for themselves.arXiv preprint arXiv:2311.04205,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.559468Z"},"links":{"cited_paper":"/paper/2311.04205","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:55d6cbf93001f512f697fa7f6f154d96cfc570ce7963f6649e8a190f0dc88ae5","observation_id":"966d0eb5-9ada-45fe-b15f-ed69797d3ebc","resolution":{"observed_at":"2026-08-11T19:01:29.559468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:01:29.554277Z","title":"RoParQ: Paraphrase-aware alignment of large language models towards robustness to paraphrased questions.arXiv preprint arXiv:2511.21568,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.554277Z"},"links":{"citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:b3f76603c40717f1c965d9c9fd0dc64d75306840ebfb1ca2401eef67698c00cb","observation_id":"af04e517-c00e-417e-9224-a77163cee234","resolution":{"observed_at":"2026-08-11T19:01:29.554277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.20653","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:02:40.405051Z","title":"Finding the sweet spot: Trading quality, cost, and speed during inference-time llm reflection.arXiv preprint arXiv:2510.20653,","venue":null,"work_id":"50e4241e-a224-4fa1-9c94-0eec6bcd2634","year":null},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.542183Z"},"links":{"citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:27880f1185d574369499d361975230724e729288e0addeb45627a63310d88c71","observation_id":"c64b5ec6-e754-426b-a1af-6a6b80e2f5e4","resolution":{"observed_at":"2026-08-11T19:02:40.409119Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.01499","last_updated":"2026-05-19T03:44:05Z","snapshot_observed_at":"2026-08-09T21:54:18.544672Z","submitted_at":"2025-10-01T22:21:50Z","title":"Beyond Majority Voting: LLM Aggregation by Leveraging Higher-Order Information","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.01499","snapshot_observed_at":"2026-08-11T19:01:29.536143Z","title":"Beyond major- ity voting: LLM aggregation by leveraging higher-order information.arXiv preprint arXiv:2510.01499,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T19:01:29.536143Z"},"links":{"cited_paper":"/paper/2510.01499","citing_paper":"/paper/2608.09351"},"observation_digest":"sha256:2e8494f3df659038a5185e8c34d8ab3182847d350c0549b8f657c082479d9ec0","observation_id":"84b3b5fa-2ca9-4e13-b78f-4a9887b3e700","resolution":{"observed_at":"2026-08-11T19:01:29.536143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.09351","last_updated":"2026-08-10T09:31:48Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T13:19:36.407028Z","submitted_at":"2026-08-10T09:31:48Z","title":"Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":7,"verified_fuzzy":1},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2608.09351."}