{"as_of":"2026-08-24T02:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d8f9209aa9230dfbaf13205e03b367f0fb767f1e09cd398133c977358772a729","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":27,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:39:31.908208Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:49:30.787818Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-18T20:50:48.912130Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-12T21:07:09.451997Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.09105","last_updated":"2025-07-01T03:47:15Z","snapshot_observed_at":"2026-08-18T05:23:07.849839Z","submitted_at":"2024-11-14T00:26:26Z","title":"VideoCogQA: A Controllable Benchmark for Evaluating Cognitive Abilities in Video-Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T21:07:09.451997Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2411.09105"},"observation_digest":"sha256:dac795e41f79d012ccd126d98a9748b3e86b4178ed66cc4b7a24a7e67c4ff2af","observation_id":"21db5bb0-2e97-4efa-a790-8c6953049514","resolution":{"observed_at":"2026-08-12T21:07:09.451997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-18T20:50:48.912130Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-11T13:15:33.958984Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-17T23:52:51.799120Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:33.958984Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:32fbac818ad2a96e0dd6995561b9df8f51b846b7e8e91d4c8839d1068c1a6006","observation_id":"71a21248-58c0-4b15-b128-e53497781a7f","resolution":{"observed_at":"2026-08-11T13:15:33.958984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-18T20:50:48.912130Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-11T13:06:05.211951Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13540","last_updated":"2025-06-06T06:41:46Z","snapshot_observed_at":"2026-08-18T20:50:57.920392Z","submitted_at":"2024-12-18T06:35:18Z","title":"Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T13:06:05.211951Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2412.13540"},"observation_digest":"sha256:beaa39adf44a50142ab8aa08425873cda12fd8999755b1a5e1a4015de1077f4a","observation_id":"0c5c3514-b454-4ea0-ace4-e3758bafacfb","resolution":{"observed_at":"2026-08-11T13:06:05.211951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-18T20:50:48.912130Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-10T22:03:13.128986Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03040","last_updated":"2025-07-21T08:01:59Z","snapshot_observed_at":"2026-08-20T01:01:25.544975Z","submitted_at":"2025-01-06T14:27:41Z","title":"ChronoSense: Exploring Temporal Understanding in Large Language Models with Time Intervals of Events","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T22:03:13.128986Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2501.03040"},"observation_digest":"sha256:6c5d1f7feecd91b769ffb83c32cbb345ba92bbc2f4067d67067ee34605661900","observation_id":"3caea6ea-dc99-4f52-895b-8cb16f54b20c","resolution":{"observed_at":"2026-08-10T22:03:13.128986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-18T20:50:48.912130Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-10T19:06:46.171743Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10674","last_updated":"2025-02-18T09:51:00Z","snapshot_observed_at":"2026-08-15T10:47:20.649898Z","submitted_at":"2025-01-18T06:41:48Z","title":"Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T19:06:46.171743Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2501.10674"},"observation_digest":"sha256:c96a6e526c7e45aa3b0837d6ce3a33743d1e5eb3de3dfb7e268a0c893bad9938","observation_id":"a2c53ff8-b438-4eed-9498-3c184a07db16","resolution":{"observed_at":"2026-08-10T19:06:46.171743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-18T20:50:48.912130Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":"2406.09170","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-07-04T03:49:30.787818Z","title":"Fatemi, M","venue":null,"work_id":"c900dc78-2091-4b54-a1a4-b4080469bcbf","year":2024},"citing_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T22:18:55.976503Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2503.19786"},"observation_digest":"sha256:41ac2b8dc9b38937068c9cbf371eec4695b22dca834a64fc9e49f5d0a0861267","observation_id":"701b9690-42cd-4c21-a48b-c459aed6ca9f","resolution":{"observed_at":"2026-05-22T22:22:12.276239Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-18T20:50:48.912130Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-07T14:47:12.799685Z","title":"Test of time: A benchmark for evaluating llms on temporal reasoning.arXiv preprint arXiv:2406.09170, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17572","last_updated":"2025-05-23T07:30:57Z","snapshot_observed_at":"2026-08-18T08:42:37.399294Z","submitted_at":"2025-05-23T07:30:57Z","title":"USTBench: Benchmarking and Dissecting Spatiotemporal Reasoning of LLMs as Urban Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:12.799685Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2505.17572"},"observation_digest":"sha256:9b648ad0b49c2f3a11639feefcd727149c8f3d17c43be8c88366586857ddc7ce","observation_id":"a59d186c-7fc3-48c5-9aa1-90e8e9f54f9b","resolution":{"observed_at":"2026-08-07T14:47:12.799685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-18T20:50:48.912130Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-07T14:17:06.234436Z","title":"Fatemi, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19533","last_updated":"2025-05-26T05:39:57Z","snapshot_observed_at":"2026-08-23T13:46:07.593798Z","submitted_at":"2025-05-26T05:39:57Z","title":"ExAnte: A Benchmark for Ex-Ante Inference in Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:06.234436Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2505.19533"},"observation_digest":"sha256:43bdb15fcfe67b6c3553066080ed11a4f20043c1b2b05b43ce43fa867cb25923","observation_id":"936d4ef5-3030-4be6-aaef-a88066aa067a","resolution":{"observed_at":"2026-08-07T14:17:06.234436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-18T20:50:48.912130Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-07T13:19:31.936216Z","title":"Test of time: A benchmark for eval- uating llms on temporal reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22112","last_updated":"2025-05-28T08:40:55Z","snapshot_observed_at":"2026-08-19T04:49:55.590336Z","submitted_at":"2025-05-28T08:40:55Z","title":"Visual Large Language Models Exhibit Human-Level Cognitive Flexibility in the Wisconsin Card Sorting Test","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:19:31.936216Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2505.22112"},"observation_digest":"sha256:e95428816b45e0c276b71d4754f326d208bb403235762a4e3ecb2018e9c53b5e","observation_id":"d0eaca58-7d6f-46f1-aefc-b450aff8d67c","resolution":{"observed_at":"2026-08-07T13:19:31.936216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-18T20:50:48.912130Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-07T10:55:00.683628Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03984","last_updated":"2025-06-04T14:14:28Z","snapshot_observed_at":"2026-08-19T12:28:33.389664Z","submitted_at":"2025-06-04T14:14:28Z","title":"Around the World in 24 Hours: Probing LLM Knowledge of Time and Place","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:00.683628Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2506.03984"},"observation_digest":"sha256:59ee8956471d040a2ac6a8470225dedb713c07505f630967aa50010eb728350f","observation_id":"a7b3db6e-b99f-4219-b7f5-47935a16ef79","resolution":{"observed_at":"2026-08-07T10:55:00.683628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-18T20:50:48.912130Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-07T05:42:48.795828Z","title":"Aaron Grattafiori, Abhimanyu Dubey, Abhinav Jauhri, Abhinav Pandey, Abhishek Kadian, Ahmad Al-Dahle, Aiesha Letman, Akhil Mathur, Alan Schelten, Alex Vaughan, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07270","last_updated":"2025-06-08T20:13:33Z","snapshot_observed_at":"2026-08-16T21:52:54.644663Z","submitted_at":"2025-06-08T20:13:33Z","title":"Question Answering under Temporal Conflict: Evaluating and Organizing Evolving Knowledge with LLMs","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:42:48.795828Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2506.07270"},"observation_digest":"sha256:50964bb67204ed1e188f8e73e2719af4803bf49a4942beac975fcb208e83b48b","observation_id":"ef337db1-38f1-45d4-9584-580608afbe32","resolution":{"observed_at":"2026-08-07T05:42:48.795828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-18T20:50:48.912130Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-07T04:33:10.361435Z","title":"Test of time: A benchmark for evaluating llms on temporal reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-17T19:26:42.531364Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:10.361435Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:2b3309c6579b1a318c60641edfe6276bb060d05256679a07521cf8859dee82b4","observation_id":"257705c7-de3a-4bd4-beb8-34177dabd9b4","resolution":{"observed_at":"2026-08-07T04:33:10.361435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-18T20:50:48.912130Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-07T01:06:09.583331Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-20T01:58:46.256423Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:09.583331Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:f85c17f647f1dbe7770a060b6a02578e9145826356e9ffadfbb265aba7a81bbb","observation_id":"008eed55-694a-4f47-b6c7-f3108658c80e","resolution":{"observed_at":"2026-08-07T01:06:09.583331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-18T20:50:48.912130Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-06T21:07:06.179002Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00914","last_updated":"2025-07-01T16:18:29Z","snapshot_observed_at":"2026-08-17T21:07:06.487336Z","submitted_at":"2025-07-01T16:18:29Z","title":"Large Language Model Powered Intelligent Urban Agents: Concepts, Capabilities, and Applications","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:06.179002Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2507.00914"},"observation_digest":"sha256:0be1c5c2dcf57ff590234f070d45b694b1069fbe191db4a77c10b7d3bf089266","observation_id":"ae106fff-8865-4154-b1c8-e276fe35ec00","resolution":{"observed_at":"2026-08-06T21:07:06.179002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-18T20:50:48.912130Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-05T12:12:58.671594Z","title":"Test of time: A benchmark for evaluating llms on temporal reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01822","last_updated":"2025-09-01T22:58:57Z","snapshot_observed_at":"2026-08-17T11:14:20.001791Z","submitted_at":"2025-09-01T22:58:57Z","title":"When LLM Meets Time Series: Can LLMs Perform Multi-Step Time Series Reasoning and Inference","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T12:12:58.671594Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2509.01822"},"observation_digest":"sha256:5655d521aa58f66fa6486059c57a016ad5b8c44890b3eed698c7f44c91e16da8","observation_id":"6fff8a26-24ac-41e9-92b6-df2e3a05366c","resolution":{"observed_at":"2026-08-05T12:12:58.671594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-18T20:50:48.912130Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-04T07:01:39.776350Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.27544","last_updated":"2026-08-09T16:20:29Z","snapshot_observed_at":"2026-08-16T07:05:11.640804Z","submitted_at":"2025-10-31T15:17:55Z","title":"TempoBench: Reasoning Execution Without Causal Attribution Is Just Simulation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T07:01:39.776350Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2510.27544"},"observation_digest":"sha256:991a63ac42ee0fc60dd10da5860f8ccf74422be64b008b0a7feda7291592718f","observation_id":"c67c6b83-db5a-435f-892a-17f3e41efe8e","resolution":{"observed_at":"2026-08-04T07:01:39.776350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-18T20:50:48.912130Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-02T21:18:01.280536Z","title":"Test of time: A benchmark for evaluating LLMs on temporal reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:01.280536Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:c4643d35322f089ee98201c66e09d56f06ae3a26e0534f3ae4da35c646b4bbd8","observation_id":"526f11c0-2670-4579-98da-bf6a8271bf3f","resolution":{"observed_at":"2026-08-02T21:18:01.280536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-18T20:50:48.912130Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":"2406.09170","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-07-04T03:49:30.787818Z","title":"Fatemi, M","venue":null,"work_id":"c900dc78-2091-4b54-a1a4-b4080469bcbf","year":2024},"citing_paper":{"arxiv_id":"2605.08766","last_updated":"2026-05-09T07:51:03Z","snapshot_observed_at":"2026-08-17T23:39:27.870729Z","submitted_at":"2026-05-09T07:51:03Z","title":"UserGPT Technical Report","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-12T03:10:51.555653Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2605.08766"},"observation_digest":"sha256:5dd6f6388f344d0023926ed46f8673cc622d3b23e4ea59b769b4070679fa52fd","observation_id":"37ce2429-69dd-49b2-8572-ac186b57fc03","resolution":{"observed_at":"2026-05-12T03:11:18.733342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-18T20:50:48.912130Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":"2406.09170","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-07-04T03:49:30.787818Z","title":"Fatemi, M","venue":null,"work_id":"c900dc78-2091-4b54-a1a4-b4080469bcbf","year":2024},"citing_paper":{"arxiv_id":"2605.18380","last_updated":"2026-05-18T13:26:14Z","snapshot_observed_at":"2026-08-13T13:28:36.738227Z","submitted_at":"2026-05-18T13:26:14Z","title":"QSTRBench: a New Benchmark to Evaluate the Ability of Language Models to Reason with Qualitative Spatial and Temporal Calculi","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T11:18:08.326304Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2605.18380"},"observation_digest":"sha256:e60b0754ae406afc44b3e1e7b2e4e41be76abaf006d6545b04ac8d936102063b","observation_id":"934c5d4d-7a78-4616-8dd7-b5f02c674d6a","resolution":{"observed_at":"2026-05-20T11:18:13.589100Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-18T20:50:48.912130Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":"2406.09170","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-07-04T03:49:30.787818Z","title":"Fatemi, M","venue":null,"work_id":"c900dc78-2091-4b54-a1a4-b4080469bcbf","year":2024},"citing_paper":{"arxiv_id":"2605.25180","last_updated":"2026-05-24T17:20:45Z","snapshot_observed_at":"2026-08-14T15:38:24.058617Z","submitted_at":"2026-05-24T17:20:45Z","title":"DateSAT: A Framework for Solving Date and Period Constraints","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T23:40:46.386350Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2605.25180"},"observation_digest":"sha256:4aa91352bec96d9e9b6a6f9cd888ef4910e1530669f31f7e68c685c22f4e7254","observation_id":"94b808d1-1c5e-4460-b603-3ca3912f676e","resolution":{"observed_at":"2026-06-29T23:44:02.905459Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-18T20:50:48.912130Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":"2406.09170","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-07-04T03:49:30.787818Z","title":"Fatemi, M","venue":null,"work_id":"c900dc78-2091-4b54-a1a4-b4080469bcbf","year":2024},"citing_paper":{"arxiv_id":"2606.05194","last_updated":"2026-07-08T19:54:16Z","snapshot_observed_at":"2026-08-06T06:51:53.907927Z","submitted_at":"2026-05-11T21:09:00Z","title":"Temporal Preference Concepts and their Functions in a Large Language Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T22:16:47.743387Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2606.05194"},"observation_digest":"sha256:378fcbbe9405d3db1bec7071afca03d07a85b29331a06778529dcae9b04e765a","observation_id":"b9a4bcb1-7ead-46b3-a648-b8d1b0ebdf04","resolution":{"observed_at":"2026-07-01T14:05:47.163039Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-18T20:50:48.912130Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-07-12T17:03:44.315006Z","title":"Test of time: A benchmark for evaluating llms on temporal reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05194","last_updated":"2026-07-08T19:54:16Z","snapshot_observed_at":"2026-08-06T06:51:53.907927Z","submitted_at":"2026-05-11T21:09:00Z","title":"Temporal Preference Concepts and their Functions in a Large Language Model","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T17:03:44.315006Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2606.05194"},"observation_digest":"sha256:19233e852ae8f80468883e57ab207cf05ebc0d3a95fd891f581d291317d67762","observation_id":"c330128e-aa3c-4114-86bb-0ddb63591bdc","resolution":{"observed_at":"2026-07-12T17:03:44.315006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-18T20:50:48.912130Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":"2406.09170","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-07-04T03:49:30.787818Z","title":"Fatemi, M","venue":null,"work_id":"c900dc78-2091-4b54-a1a4-b4080469bcbf","year":2024},"citing_paper":{"arxiv_id":"2606.11470","last_updated":"2026-08-10T19:13:02Z","snapshot_observed_at":"2026-08-14T23:09:31.705348Z","submitted_at":"2026-06-09T21:59:37Z","title":"The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-27T12:59:51.091008Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2606.11470"},"observation_digest":"sha256:d61ab57bb1de04992bb9ade1ff0f0cb01d3aedeafec0ec14d5ff2f3f68e67d8c","observation_id":"eac11a36-2567-455d-8e75-e941472b1e9c","resolution":{"observed_at":"2026-07-03T05:57:41.660552Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-18T20:50:48.912130Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":"2406.09170","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-07-04T03:49:30.787818Z","title":"Fatemi, M","venue":null,"work_id":"c900dc78-2091-4b54-a1a4-b4080469bcbf","year":2024},"citing_paper":{"arxiv_id":"2606.20959","last_updated":"2026-08-05T19:11:41Z","snapshot_observed_at":"2026-08-17T00:17:25.426651Z","submitted_at":"2026-06-18T21:56:18Z","title":"Right Knowledge, Wrong Answer: Characterizing Parametric Temporal Conflict in Open-Weight Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-26T17:35:09.053339Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2606.20959"},"observation_digest":"sha256:6c2d9ee437da4c6b46ea2ccfa8f34bd4cf34b003f7a4eaba143ea75b40b16b9c","observation_id":"e658e87e-c84b-450e-bac7-6044229ab2c6","resolution":{"observed_at":"2026-07-04T03:49:30.789947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-18T20:50:48.912130Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-02T10:48:06.378923Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20959","last_updated":"2026-08-05T19:11:41Z","snapshot_observed_at":"2026-08-17T00:17:25.426651Z","submitted_at":"2026-06-18T21:56:18Z","title":"Right Knowledge, Wrong Answer: Characterizing Parametric Temporal Conflict in Open-Weight Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-02T10:48:06.378923Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2606.20959"},"observation_digest":"sha256:77b478bff52e0f998528dad28fbe5b28b897e42060ed5da67a24a5d102c6d937","observation_id":"56df4af4-6623-441c-9983-a6bfa62726ee","resolution":{"observed_at":"2026-08-02T10:48:06.378923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-18T20:50:48.912130Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":"2406.09170","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-07-04T03:49:30.787818Z","title":"Fatemi, M","venue":null,"work_id":"c900dc78-2091-4b54-a1a4-b4080469bcbf","year":2024},"citing_paper":{"arxiv_id":"2606.27378","last_updated":"2026-05-07T04:04:25Z","snapshot_observed_at":"2026-08-13T09:55:08.244211Z","submitted_at":"2026-05-07T04:04:25Z","title":"Formalizing Latent Thoughts: Four Axioms of Thought Representation in LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T23:50:48.584391Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2606.27378"},"observation_digest":"sha256:d0dbae74bda11091af20e73f1f94f2211f9bc16309ba45af4627c5e1bfb9e4ca","observation_id":"7d0781ab-3bc1-4bfd-80c5-66fde80ecc12","resolution":{"observed_at":"2026-07-01T13:15:45.637923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-18T20:50:48.912130Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-14T04:39:31.908208Z","title":"Google DeepMind","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.08512","last_updated":"2026-08-09T06:17:41Z","snapshot_observed_at":"2026-08-20T13:20:38.994133Z","submitted_at":"2026-08-09T06:17:41Z","title":"Time Present and Time Past: Benchmarking Large Language Models on Temporally Evolving Document Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T04:39:31.908208Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2608.08512"},"observation_digest":"sha256:8ff3f4b4a652dbed2ae344568a3f6187002f2516492f30916d638ff2a9ba7498","observation_id":"4b3b03a4-708c-4392-b423-7b3f4c5ed25c","resolution":{"observed_at":"2026-08-14T04:39:31.908208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.09170/citation-record","integrity":"/paper/2406.09170/integrity","json":"/paper/2406.09170/citation-record.json","paper":"/paper/2406.09170"},"outbound":[],"paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T20:50:48.912130Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 27 inbound Pith citation observations for arXiv:2406.09170."}