{"as_of":"2026-08-10T05:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:11dafa5f494e34b1ffd9e390265a905e91ed6ddb0b0a6ad0e79d2c1b345f0c62","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:17:44.275296Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:38:56.081466Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":"2502.12118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-07-03T20:38:56.081466Z","title":"Scalingtest-timecomputewithout verification or rl is suboptimal","venue":null,"work_id":"f01d383c-eb52-4fe5-8e17-9f763cf82d39","year":2025},"citing_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-19T06:59:03.112252Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2503.17352"},"observation_digest":"sha256:da57ee18ef905631af7d8079b29a2a9f7a01b27f1465506854cdb834aa46421a","observation_id":"8bbf0e62-8788-46db-b714-22f2cd90189d","resolution":{"observed_at":"2026-05-19T06:59:03.238636Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":"2502.12118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-07-03T20:38:56.081466Z","title":"Scalingtest-timecomputewithout verification or rl is suboptimal","venue":null,"work_id":"f01d383c-eb52-4fe5-8e17-9f763cf82d39","year":2025},"citing_paper":{"arxiv_id":"2504.01990","last_updated":"2025-08-02T12:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T18:00:29Z","title":"Advances and Challenges in Foundation Agents: From Brain-Inspired Intelligence to Evolutionary, Collaborative, and Safe Systems","version":2},"reference_index":211,"source":"pdf_text","source_observed_at":"2026-05-22T21:39:49.832151Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2504.01990"},"observation_digest":"sha256:8a856e3540366b1c55ff79a46ed87d2353cc083fe1b75bb36f68237d36a72831","observation_id":"58108822-4319-4b0e-9fc6-2ea880285d84","resolution":{"observed_at":"2026-05-22T21:42:10.540276Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":"2502.12118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-07-03T20:38:56.081466Z","title":"Scalingtest-timecomputewithout verification or rl is suboptimal","venue":null,"work_id":"f01d383c-eb52-4fe5-8e17-9f763cf82d39","year":2025},"citing_paper":{"arxiv_id":"2505.15134","last_updated":"2025-05-21T05:39:11Z","snapshot_observed_at":"2026-08-08T21:58:35.154185Z","submitted_at":"2025-05-21T05:39:11Z","title":"The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-18T15:58:33.219451Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2505.15134"},"observation_digest":"sha256:e562df753a160802be149fcd2ec93c9b0931ee4aeae42ef6a761abd867cfc3d9","observation_id":"d61edaaa-bdcf-42ae-ab77-16a2fcdc166a","resolution":{"observed_at":"2026-05-18T15:58:33.485438Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-07T14:17:44.275296Z","title":"Scaling test-time compute without verification or rl is suboptimal.arXiv preprint arXiv:2502.12118,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19475","last_updated":"2025-05-28T11:04:19Z","snapshot_observed_at":"2026-08-08T15:11:51.265629Z","submitted_at":"2025-05-26T03:54:47Z","title":"Continuous Self-Improvement of Large Language Models by Test-time Training with Verifier-Driven Sample Selection","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:44.275296Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2505.19475"},"observation_digest":"sha256:63a87c5ebe48e266ee649ba385d879e1be0b765863030ee9dc75e8e7276d9fbf","observation_id":"38e18a3b-642c-459f-8caa-ccc9876c8e26","resolution":{"observed_at":"2026-08-07T14:17:44.275296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-07T14:14:22.796446Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19634","last_updated":"2025-09-12T01:41:20Z","snapshot_observed_at":"2026-08-10T02:29:59.608724Z","submitted_at":"2025-05-26T07:51:30Z","title":"Faster and Better LLMs via Latency-Aware Test-Time Scaling","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:22.796446Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2505.19634"},"observation_digest":"sha256:3ef786aa5cd4039f4f7e3c81128cde23cb01056416d09f6567a6c89af000e2e4","observation_id":"00262278-648d-401e-83b7-43a01aac0f27","resolution":{"observed_at":"2026-08-07T14:14:22.796446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-07T13:58:36.660912Z","title":"Scaling test-time compute without verification or rl is suboptimal.arXiv preprint arXiv:2502.12118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20522","last_updated":"2025-06-07T22:18:32Z","snapshot_observed_at":"2026-08-09T15:58:57.474733Z","submitted_at":"2025-05-26T20:58:45Z","title":"Scaling over Scaling: Exploring Test-Time Scaling Plateau in Large Reasoning Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:58:36.660912Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2505.20522"},"observation_digest":"sha256:04345541f31ddcac7bbc39c99d9327d382fcd4cef115aac4d423456a4ffd379d","observation_id":"0ca12fc2-9a90-4756-9d71-03f3a2ca862b","resolution":{"observed_at":"2026-08-07T13:58:36.660912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":"2502.12118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-07-03T20:38:56.081466Z","title":"Scalingtest-timecomputewithout verification or rl is suboptimal","venue":null,"work_id":"f01d383c-eb52-4fe5-8e17-9f763cf82d39","year":2025},"citing_paper":{"arxiv_id":"2505.23912","last_updated":"2026-05-13T21:21:09Z","snapshot_observed_at":"2026-08-02T15:55:45.353476Z","submitted_at":"2025-05-29T18:05:20Z","title":"LoVeC: Reinforcement Learning for Better Verbalized Confidence in Long-Form Generations","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-19T12:43:51.019983Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2505.23912"},"observation_digest":"sha256:56f1289cc654fcc3297f8428c2164e69c921562333c40ca7dac00fe664f4df2d","observation_id":"4fd36060-3c10-44c7-b923-e4aacd158829","resolution":{"observed_at":"2026-05-19T12:47:17.990957Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-07T12:02:45.177987Z","title":"Scaling test-time compute without verification or rl is suboptimal","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00845","last_updated":"2025-08-17T12:17:48Z","snapshot_observed_at":"2026-08-07T16:09:18.251031Z","submitted_at":"2025-06-01T05:39:56Z","title":"Generalizable LLM Learning of Graph Synthetic Data with Post-training Alignment","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T12:02:45.177987Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2506.00845"},"observation_digest":"sha256:192b97f4bc9be75a2f5b93419a17dcf33ad3695764bd4934fb6b97dd05e7b8f4","observation_id":"55ac6afc-efc0-4230-bf21-ea854c17561c","resolution":{"observed_at":"2026-08-07T12:02:45.177987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-07T10:42:41.015386Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04611","last_updated":"2025-06-05T04:02:17Z","snapshot_observed_at":"2026-08-09T14:45:17.460081Z","submitted_at":"2025-06-05T04:02:17Z","title":"Revisiting Test-Time Scaling: A Survey and a Diversity-Aware Method for Efficient Reasoning","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T10:42:41.015386Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2506.04611"},"observation_digest":"sha256:0133127e01178606368220ac297e7acca2b8adfd5eb911d23d22b592e856a9b6","observation_id":"c5cb6b72-cbe8-4b35-8f4d-b19e3acc3ea8","resolution":{"observed_at":"2026-08-07T10:42:41.015386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-07T10:35:37.965006Z","title":"Setlur, N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05295","last_updated":"2025-06-12T16:25:06Z","snapshot_observed_at":"2026-08-09T19:56:00.688282Z","submitted_at":"2025-06-05T17:48:19Z","title":"Sample Complexity and Representation Ability of Test-time Scaling Paradigms","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:37.965006Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2506.05295"},"observation_digest":"sha256:f13b904a0d263019b83978f77fa32bf8fcabc323f59b4331b42af8a81ac6531e","observation_id":"e0e4fd3c-792e-4adf-918e-215295894e38","resolution":{"observed_at":"2026-08-07T10:35:37.965006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-07T05:27:50.219788Z","title":"Scaling test- time compute without verification or rl is suboptimal.ArXiv, abs/2502.12118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.219788Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:0c2481fda915c7e95b2e5226a150801ad671907d6b0989f55606947862324ea3","observation_id":"f20f4c7f-9d7b-48aa-9f8d-bad1bab99af3","resolution":{"observed_at":"2026-08-07T05:27:50.219788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-07T05:03:27.653994Z","title":"Scaling test-time compute without verification or rl is suboptimal.arXiv preprint arXiv:2502.12118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-09T06:45:47.107738Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.653994Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:fe7db6e5e4e6f34fc828188128635a449ff1b94c66f2e2bc82c5d97c5e12bff0","observation_id":"d155d0d9-b405-46c5-9231-8f57d771e0eb","resolution":{"observed_at":"2026-08-07T05:03:27.653994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-06T23:36:10.024727Z","title":"Scaling test- time compute without verification or rl is suboptimal,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17601","last_updated":"2025-06-21T05:39:04Z","snapshot_observed_at":"2026-08-08T15:11:41.417296Z","submitted_at":"2025-06-21T05:39:04Z","title":"Risk-Guided Diffusion: Toward Deploying Robot Foundation Models in Space, Where Failure Is Not An Option","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:36:10.024727Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2506.17601"},"observation_digest":"sha256:b19e353404d6bb13b701d3313da5a2a9e6c3cf588d7ab2cfa14d96974399bbef","observation_id":"c3185151-7874-4f06-bdd5-076ba5a0224f","resolution":{"observed_at":"2026-08-06T23:36:10.024727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-06T18:11:18.663876Z","title":", author Rajaraman, N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09075","last_updated":"2025-07-11T23:35:54Z","snapshot_observed_at":"2026-08-09T12:00:51.451716Z","submitted_at":"2025-07-11T23:35:54Z","title":"OpenCodeReasoning-II: A Simple Test Time Scaling Approach via Self-Critique","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T18:11:18.663876Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2507.09075"},"observation_digest":"sha256:1d34c2d2ed98a450bb4bd81805dcf8a2e5c7e78c6d7b709a174f7bd3cd17dc2a","observation_id":"db2f22e1-3716-4ea5-b409-8dafbf119d55","resolution":{"observed_at":"2026-08-06T18:11:18.663876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-05T13:52:50.698310Z","title":"Setlur, N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00271","last_updated":"2026-06-17T20:45:44Z","snapshot_observed_at":"2026-08-08T09:36:37.528608Z","submitted_at":"2025-08-29T22:56:32Z","title":"Learn from What We HAVE: History-Aware VErifier that Reasons about Past Interactions Online","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T13:52:50.698310Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2509.00271"},"observation_digest":"sha256:aaed26c0e152b5dc61399eb0579fe26b38bc3a8b722776d7c4306786a04b59bc","observation_id":"cd3a6297-62fc-40ba-8849-979f98675793","resolution":{"observed_at":"2026-08-05T13:52:50.698310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-05T10:31:37.862981Z","title":"Scaling test-time compute without verification or rl is suboptimal","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04027","last_updated":"2026-06-09T07:28:31Z","snapshot_observed_at":"2026-08-09T08:53:17.340894Z","submitted_at":"2025-09-04T09:02:16Z","title":"Why Does Reasoning Length Converge? Unveiling the Underfitting-Overfitting Trade-off in Chain-of-Thought","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T10:31:37.862981Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2509.04027"},"observation_digest":"sha256:30f09d0ebfd0ca19ccbf2fb7ea0597871501da7fec6681ad1b46b46333b645d0","observation_id":"c3121a39-00b2-46a5-a1ab-654f921f914f","resolution":{"observed_at":"2026-08-05T10:31:37.862981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-04T21:32:59.185386Z","title":"Scaling test-time compute without verification or rl is suboptimal.arXiv preprint arXiv:2502.12118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07953","last_updated":"2025-09-09T17:41:29Z","snapshot_observed_at":"2026-08-08T15:11:35.635416Z","submitted_at":"2025-09-09T17:41:29Z","title":"RaC: Robot Learning for Long-Horizon Tasks by Scaling Recovery and Correction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T21:32:59.185386Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2509.07953"},"observation_digest":"sha256:d34f7e4d7a0da78ca102b0742a0fba5ad83c09d8ab3e8a98fb5d391e18f4b09f","observation_id":"7a0040a0-e9bb-426a-964a-23a9867f6fc7","resolution":{"observed_at":"2026-08-04T21:32:59.185386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-03T21:03:18.958441Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.21734","last_updated":"2026-05-23T06:59:38Z","snapshot_observed_at":"2026-08-09T23:24:20.771004Z","submitted_at":"2025-11-21T09:55:34Z","title":"Asking LLMs to Verify First is Almost Free Lunch","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-03T21:03:18.958441Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2511.21734"},"observation_digest":"sha256:47f2cb3de6dea29d8f7eea60cc4317e14ff7e8b9182b9b8f868f1a10f34f0e99","observation_id":"3cd3c06e-92ef-46b1-b172-6c3976ea4406","resolution":{"observed_at":"2026-08-03T21:03:18.958441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":"2502.12118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-07-03T20:38:56.081466Z","title":"Scalingtest-timecomputewithout verification or rl is suboptimal","venue":null,"work_id":"f01d383c-eb52-4fe5-8e17-9f763cf82d39","year":2025},"citing_paper":{"arxiv_id":"2603.04333","last_updated":"2026-05-08T20:08:31Z","snapshot_observed_at":"2026-07-31T16:31:42.095039Z","submitted_at":"2026-03-04T17:51:30Z","title":"What Does Flow Matching Bring To TD Learning?","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-15T16:32:29.432272Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2603.04333"},"observation_digest":"sha256:3a3297d994c79aebbd6f848ece9e111313720312ee7806cd7a57539ba54560c2","observation_id":"93315f33-d916-44be-ae74-e752e30de6b1","resolution":{"observed_at":"2026-05-15T16:36:17.910581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":"2502.12118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-07-03T20:38:56.081466Z","title":"Scalingtest-timecomputewithout verification or rl is suboptimal","venue":null,"work_id":"f01d383c-eb52-4fe5-8e17-9f763cf82d39","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:c2741e458a2926453510e0d8e1ecc1ffbe81a445590e120bbeac2122235374d5","observation_id":"7eaa64f9-baa4-4f34-8c4d-6dd271c40469","resolution":{"observed_at":"2026-05-11T14:16:05.777615Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":"2502.12118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-07-03T20:38:56.081466Z","title":"Scalingtest-timecomputewithout verification or rl is suboptimal","venue":null,"work_id":"f01d383c-eb52-4fe5-8e17-9f763cf82d39","year":2025},"citing_paper":{"arxiv_id":"2605.15513","last_updated":"2026-05-15T01:16:12Z","snapshot_observed_at":"2026-08-01T17:14:08.866403Z","submitted_at":"2026-05-15T01:16:12Z","title":"CAPS: Cascaded Adaptive Pairwise Selection for Efficient Parallel Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-19T15:39:56.255871Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2605.15513"},"observation_digest":"sha256:3531994bff1e41076237c95de96a145faed5a5c6abc6f87f4110291b9ccad847","observation_id":"deee3ea0-b457-41b0-a510-eddef6dc0fa7","resolution":{"observed_at":"2026-05-19T15:42:38.364806Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":"2502.12118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-07-03T20:38:56.081466Z","title":"Scalingtest-timecomputewithout verification or rl is suboptimal","venue":null,"work_id":"f01d383c-eb52-4fe5-8e17-9f763cf82d39","year":2025},"citing_paper":{"arxiv_id":"2605.30070","last_updated":"2026-05-28T15:17:19Z","snapshot_observed_at":"2026-07-06T23:39:24.682426Z","submitted_at":"2026-05-28T15:17:19Z","title":"A Predictive Law for On-Policy Self-Distillation From World Feedback","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T09:08:16.307499Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2605.30070"},"observation_digest":"sha256:7c22f8029882d5097fe4fd82b7b3fbb418d2a146f8e8f6db8666b0bcee5d676e","observation_id":"0c548352-46e2-484a-bb5d-e726d873864a","resolution":{"observed_at":"2026-06-29T09:13:16.210460Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":"2502.12118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-07-03T20:38:56.081466Z","title":"Scalingtest-timecomputewithout verification or rl is suboptimal","venue":null,"work_id":"f01d383c-eb52-4fe5-8e17-9f763cf82d39","year":2025},"citing_paper":{"arxiv_id":"2606.01075","last_updated":"2026-06-02T05:50:15Z","snapshot_observed_at":"2026-08-08T11:14:54.052517Z","submitted_at":"2026-05-31T07:43:19Z","title":"On the Generalization Gap in Self-Evolving Language Model Reasoning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T17:18:37.671369Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2606.01075"},"observation_digest":"sha256:8f4f1bea09573050ce943583422637286dad145c38febae0ac5245560d0f3236","observation_id":"959bee1d-0987-4be4-adfc-c3212bae2d98","resolution":{"observed_at":"2026-06-28T17:22:24.924302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":"2502.12118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-07-03T20:38:56.081466Z","title":"Scalingtest-timecomputewithout verification or rl is suboptimal","venue":null,"work_id":"f01d383c-eb52-4fe5-8e17-9f763cf82d39","year":2025},"citing_paper":{"arxiv_id":"2606.18089","last_updated":"2026-07-05T17:40:26Z","snapshot_observed_at":"2026-07-12T13:34:39.011240Z","submitted_at":"2026-06-16T15:55:28Z","title":"From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-06-27T01:13:11.483599Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2606.18089"},"observation_digest":"sha256:916f8dc3105cdbd5caf8abf179de91f290c931a490508278576d3200709be5bf","observation_id":"49abea7f-0bf0-4190-a9ec-c0beb200826f","resolution":{"observed_at":"2026-07-03T20:38:56.082787Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-07-13T03:00:51.318412Z","title":"Setlur, N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09438","last_updated":"2026-07-10T14:09:04Z","snapshot_observed_at":"2026-08-06T13:00:09.267598Z","submitted_at":"2026-07-10T14:09:04Z","title":"Test-Time Scaling for Small VLMs on Multilingual Visual MCQ","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T03:00:51.318412Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2607.09438"},"observation_digest":"sha256:d07beadc1e3ede09fb01d60967f23075b1eaf5071bd18bdad18a13fd2dbe6d49","observation_id":"ec8e1e04-02ca-48cf-8566-aa37402a0fb1","resolution":{"observed_at":"2026-07-13T03:00:51.318412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-01T17:46:56.344831Z","title":"arXiv preprint arXiv:2502.12118 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17531","last_updated":"2026-07-20T04:09:19Z","snapshot_observed_at":"2026-08-01T17:46:52.974934Z","submitted_at":"2026-07-20T04:09:19Z","title":"Oracle Gap and Signal Fidelity: A Fixed-Pool Diagnostic for Test-Time Collaboration","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T17:46:56.344831Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2607.17531"},"observation_digest":"sha256:98424dba2d7fa16332969d60f3e0c4c81989dc2d27c5883188259cd353bf4379","observation_id":"86aa1bbb-a3b7-404f-b30e-bee62b08caac","resolution":{"observed_at":"2026-08-01T17:46:56.344831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.12118/citation-record","integrity":"/paper/2502.12118/integrity","json":"/paper/2502.12118/citation-record.json","paper":"/paper/2502.12118"},"outbound":[],"paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 26 inbound Pith citation observations for arXiv:2502.12118."}