{"as_of":"2026-08-08T22:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c20daa21acd5d37ba6dd68f8ae44d9caa73ff4f6084a988dac1062a00ebccfc7","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T13:34:00.838394Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.04784/citation-record","integrity":"/paper/2607.04784/integrity","json":"/paper/2607.04784/citation-record.json","paper":"/paper/2607.04784"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":null,"venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:b461856464c43be5d75e24ade266699859906ca7cb1056579685e84582d1ed28","observation_id":"6c3a14bf-fd0c-4ef7-8c4b-8bd6ba6d97d0","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":null,"venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:3c6b14cc355a97686e310d368f9df77adc51675e932f9a39b3444a236349a124","observation_id":"c619b2fc-b5ac-4776-9d9a-05e87a397480","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:7d1837bb128d15118abe78941725ccbd367acddc0280bb74ca05d147a01c38c4","observation_id":"34564c61-e8d6-4231-966d-39c28cc3f676","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":"arXiv:2407.21787 doi:10.48550/ARXIV.2407.21787","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:b0305d39b2d236911346bd51fd44b6ccf544aadbceed58edc8fe50d564c5cc69","observation_id":"f1c8e679-5f44-46fc-8188-14e384611fa8","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:472ac65a5c8ff393c384e5e795d0cf944e8df2a5edcf919ca61c4775506ff179","observation_id":"e4a74322-5fed-487d-b959-b5ec55bedc0d","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.66","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"b3530e3b-6922-40c3-8771-389bc99f7a11","year":2024},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:d11abd57982f69e01755f56fa40da6bf2ca453738ffd52596794ab3ae3da664b","observation_id":"f50e4a24-f48c-4a40-8d25-c4ac65f5828e","resolution":{"observed_at":"2026-07-11T13:38:02.404961Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-01T09:08:03.939029+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T09:08:03.939029+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:0b70ac62e672f87942271d0d4144f44c0d6bcdfd10a2b90e0f5e2c998bdae33d","observation_id":"46a1a705-b8e8-4f27-9d58-8596ce78a035","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:9f19ce7315c0afa0eb8ecb0d9d3d987c542382e999f208cf5f6009df7e91a976","observation_id":"bc5c057b-b3a4-4d79-8f6d-534d54221f90","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:3cf32ee9a27f4c615bac3ae4968f8f985b33159afc6a8d82caf248d7b9bee072","observation_id":"6849083c-039d-469e-8fe4-cd5cdc6cec18","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:afc9dddfa9254080af42e028ca75fb501fbb460f4c6acdcc7b192cfa9a4da5c2","observation_id":"95ee6c6a-3571-4c4c-b6f1-040cebff7a27","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:fd7dfcf3f86e62cb5cd394097f58cf62438a9bea2d8c6aa10a1164d6ba0989d0","observation_id":"05106515-946f-455b-96de-920cb961bc9d","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:9f64d9560a1f4c47bb13fba27eaa6b3ba1fe0bf604d5e0fe9fd671cc1a9002cb","observation_id":"79f386f6-8d73-463d-ae14-033154983ec8","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":"https://openreview.net/forum?id=yf1icZHC-l9","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:fe2e317a3e04906f789045d8d962ebb1521b7085678652d81cd3155b9575e51e","observation_id":"f719ba36-c639-45c7-8cbe-e149577c144a","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:b5936823c62df26d4a29fcac1d88e5637fa339974466796c886cf14adf64779e","observation_id":"9a663235-3f48-483f-a163-8eb42062f7fc","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:a410326978c8eef75452288d71bc81ea1fa64af2bcabbbc9abcf3e2ee644b7db","observation_id":"88907b44-9611-4076-9dce-9eb2a9c65400","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:3efcd623f29f4c86b2ae604b8057a66899f3aa18912ed53473039259ec809926","observation_id":"4ac3d6ff-c019-4f5d-8219-3d8a8bdac728","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1996.555682","doi":"10.1109/time.1996.555682","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"11f9b7ca-ef9c-437a-ae94-cfd962825b23","year":1996},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:62ca27b3d70beb4303f505bd2efae298863addbc9d5ab7611ad97c5588ef509e","observation_id":"70c1ef3d-f782-4482-81e6-7b768473f40e","resolution":{"observed_at":"2026-07-11T13:38:02.410323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-12T02:20:42.533018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T02:20:42.533018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:8c7734ef9391774415265f4029b34ebd07fd2c6a55e1a649ce6a68cd78280b63","observation_id":"e2d9caa8-8513-472b-b939-e0f30b1aa550","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":"Lake and Marco Baroni","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:dbfa60b04e7b0c309c3b50581ca3f03b9f41965e005185b3cbc762783de05606","observation_id":"7c732a72-921f-490f-a01a-c3c72f8c3bf1","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:cd7cedc57b7a35f0ab1f7133dae58c2418223221cc4b4444c45e0547cd181acb","observation_id":"f5d49fb3-577b-47e0-8ffc-4baf9ed3b191","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:468731d4f935fc47dff34e71d98d1bbde5ad04c2b69687fe4cbc643c4dc96839","observation_id":"573b6bb1-846a-47a0-b1f7-01751de772be","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:5242eab66e847802d6508ef4fd0cdb48b4d7c82087f09bd3907fbf4bb5db0a9a","observation_id":"9b77c8e3-0cf7-4f0b-81ba-251dc94488a8","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":"Chatterji, Faisal Ladhak, and Tatsunori Hashimoto","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:1eb9949fc9de0de61fd9b553f6a15bba38cc72609fa4f3d3e929e1ac4a09ea28","observation_id":"609d6f68-09db-4c0b-bb18-e68d29784015","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23480","last_updated":"2025-05-29T14:30:02Z","snapshot_observed_at":"2026-08-07T12:42:51.966401Z","submitted_at":"2025-05-29T14:30:02Z","title":"Revisiting Overthinking in Long Chain-of-Thought from the Perspective of Self-Doubt","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23480","snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"cited_paper":"/paper/2505.23480","citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:b71e7c571b17251727aca94e859e4b23593755c0a3607a19dc88960be5ba0660","observation_id":"4eca968b-b227-421e-94ac-30ff9af91a3e","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:5730bbd8a11b68c9faf6477b41d8a091d5989e64d95bd856b9da8f820ecb0223","observation_id":"73cac8cb-69d6-4d4f-8e4b-0f4d761c1296","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":"Hamilton","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:c979585915dca9966f841177234eff15a9c1893cb0df020f74ec720deae76e98","observation_id":"d5fcd0ed-c71d-47cb-823b-36626f6f528b","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:2ae36dc9b1d5a436f68555f07e9353295a6ebc594c57c83263d9eab37e8d7ac5","observation_id":"bc750336-40a8-4a61-9a8d-a329e02a2d35","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":"Le, Ed H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:7a446d595079dfa0236a9e8c662a093afb9a1fda3013f99328020176a60fce8d","observation_id":"65f59cea-7e0b-4c4d-8142-b216caaae51a","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:7babb568189aaeae8eaca88a5c51bb718ef34bf4fece7bb09322f6d584294987","observation_id":"22c245ae-8ed7-46d5-b7e2-ae47af544e28","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:5b9daedc7e537b84df058b23dc8175a14ae07dfcec61e2fd6486b898838ce2a6","observation_id":"87be9927-757f-4b27-b0ee-0ad772bb8701","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":"Le, Ed H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:055d39697391b99d7aa699bfb0bffc701e1b7d8da5bc5a16d9b4adb2893299d0","observation_id":"37ebf73a-f3c8-4b75-b869-d3c62d9121ba","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:82b59bf3bf932e5bfd9d965bf934258719cc8fe9961f383cb9bdfd7f4b990353","observation_id":"ebec8478-01d2-4e7c-bcc4-7407f8ccbdce","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":"Chi, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:89ee2289d1832e1806a88437df482b50792020ee86e9ecc1f0c25986b20b69b4","observation_id":"286d6434-ffb2-4985-b7b5-47c6aeb07bf5","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:98e621c07a960d53edaed1d223888b6249e8d1a025f0425611ef75579c677534","observation_id":"ee0469eb-1753-4770-b9d2-21071a1aa07f","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:6b8433ed53669aee5935a0ffed0d220a28d7223a43ec05c4fe416fc137d13ab5","observation_id":"d0c988c0-ab82-4429-b1da-f9b4940f545d","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:34:00.838394Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T13:34:00.838394Z"},"links":{"citing_paper":"/paper/2607.04784"},"observation_digest":"sha256:0b37893f284dfa126f9c58ecd5404f73b7b4918b629d8ced57b53c253124d651","observation_id":"c9fa29fa-f526-4dbc-a63c-5f5736c220ce","resolution":{"observed_at":"2026-07-11T13:34:00.838394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.04784","last_updated":"2026-07-06T08:14:53Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-08T18:35:58.623903Z","submitted_at":"2026-07-06T08:14:53Z","title":"A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2607.04784."}