{"as_of":"2026-08-10T17:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:15f02a2515ca7caf828ca3f7a9552ed6e9e9e374681931985207c1288cad60a6","coverage":[{"denominator":95,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":95,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T07:02:51.850836Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T04:59:12.973916Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T00:12:15.992700Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05391","snapshot_observed_at":"2026-08-01T17:46:56.897385Z","title":"arXiv preprint arXiv:2607.05391 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17531","last_updated":"2026-07-20T04:09:19Z","snapshot_observed_at":"2026-08-01T17:46:52.974934Z","submitted_at":"2026-07-20T04:09:19Z","title":"Oracle Gap and Signal Fidelity: A Fixed-Pool Diagnostic for Test-Time Collaboration","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T17:46:56.897385Z"},"links":{"cited_paper":"/paper/2607.05391","citing_paper":"/paper/2607.17531"},"observation_digest":"sha256:a3ab4bd6ed8effbf3af6a0b2ea229e5a66642bd54d3590e2ffa52b02d6236385","observation_id":"d1f2b67b-4c8d-4134-a93a-2b055208e62b","resolution":{"observed_at":"2026-08-01T17:46:56.897385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05391","snapshot_observed_at":"2026-07-30T18:33:28.512215Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26873","last_updated":"2026-07-31T13:09:25Z","snapshot_observed_at":"2026-08-10T14:17:12.411816Z","submitted_at":"2026-07-29T13:03:07Z","title":"SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-30T18:33:28.512215Z"},"links":{"cited_paper":"/paper/2607.05391","citing_paper":"/paper/2607.26873"},"observation_digest":"sha256:9514396e4678d3d6e53f567854253e16451bde988b192112be7395f893c7997f","observation_id":"5635ad34-a720-4065-b69f-b132099a4386","resolution":{"observed_at":"2026-07-30T18:33:28.512215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05391","snapshot_observed_at":"2026-08-03T01:47:25.009152Z","title":"2607.05391 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26873","last_updated":"2026-07-31T13:09:25Z","snapshot_observed_at":"2026-08-10T14:17:12.411816Z","submitted_at":"2026-07-29T13:03:07Z","title":"SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-03T01:47:25.009152Z"},"links":{"cited_paper":"/paper/2607.05391","citing_paper":"/paper/2607.26873"},"observation_digest":"sha256:07c22a4c6979086b52677acb865b04dc1d974f66411a4c4fbd285a9b288c9b84","observation_id":"324234cf-96c5-40a6-9c77-9101aa57a1d3","resolution":{"observed_at":"2026-08-03T01:47:25.009152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"cited_work":{"arxiv_id":"2607.05391","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.05391","snapshot_observed_at":"2026-08-06T00:12:15.992700Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","venue":"cs.AI","work_id":"f6a7c967-6baf-4c64-94a7-317699ee8d07","year":2026},"citing_paper":{"arxiv_id":"2608.02677","last_updated":"2026-08-02T20:09:02Z","snapshot_observed_at":"2026-08-08T09:34:49.643122Z","submitted_at":"2026-08-02T20:09:02Z","title":"When Policies Change Probabilities: Modular Decision-Making for LLM Code Review","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T00:12:15.578147Z"},"links":{"cited_paper":"/paper/2607.05391","citing_paper":"/paper/2608.02677"},"observation_digest":"sha256:979201f51dfa47d73afb481a5c3b5620f0f21a2329d745a51d3ffa5823fc9002","observation_id":"a8dd1fcd-b443-4331-a919-1f7c28ec0438","resolution":{"observed_at":"2026-08-06T00:12:15.996343Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05391","snapshot_observed_at":"2026-08-10T04:59:12.973916Z","title":"LLM -as-a-Verifier: A general-purpose verification framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07418","last_updated":"2026-08-07T17:04:41Z","snapshot_observed_at":"2026-08-10T17:13:21.886374Z","submitted_at":"2026-08-07T17:04:41Z","title":"ResidencyRL: Reinforcement Learning in Simulated Clinical Environments","version":1},"reference_index":195,"source":"arxiv_source","source_observed_at":"2026-08-10T04:59:12.973916Z"},"links":{"cited_paper":"/paper/2607.05391","citing_paper":"/paper/2608.07418"},"observation_digest":"sha256:055bb583e10a361ef4a56cd28e7c2842264c1191be571a5bdccd215cd22b4146","observation_id":"e511c256-8f9b-42bf-8f51-b1c08c10a7fd","resolution":{"observed_at":"2026-08-10T04:59:12.973916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.05391/citation-record","integrity":"/paper/2607.05391/integrity","json":"/paper/2607.05391/citation-record.json","paper":"/paper/2607.05391"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:5e15189a81b1bf4792c3fd15681274179a78681ea28525d247ad6b7791416d3c","observation_id":"f55c91b1-5d47-4fd1-b038-e60d40f7924f","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10760","last_updated":"2022-10-19T17:56:10Z","snapshot_observed_at":"2026-07-06T14:07:50.468967Z","submitted_at":"2022-10-19T17:56:10Z","title":"Scaling Laws for Reward Model Overoptimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10760","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Scaling Laws for Reward Model Overoptimization, October 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2210.10760","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:aa36da2387c57bd0e19c5862ca73c7cd8f02dee18ee1e24337addb7551062698","observation_id":"8ffa3366-e39a-4f28-a0f8-52935f8c285c","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters, August 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:488853af92c2a688fc83483f95ea7816e6ffb16acfb0d918adb9d48c17a9a839","observation_id":"71e92306-613b-4935-a0ad-b753355627b2","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:9543add71f9318023e7ba6acef31eb954dfa9f7ac0a7aa29bf19178f8ed75b18","observation_id":"b4c59a75-bbb2-4f71-a591-975a8e9f859c","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"URLhttps://arxiv.org/abs/2603.04304","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:a5de0b126c172466a8a8e9191bfb998cab8812776e15c3bdad439c4b637e052c","observation_id":"ab9f7920-47d7-416e-8226-cf0ff9ec9e1d","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-07-06T19:06:41.697671Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Generative verifiers: Reward modeling as next-token prediction, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:2f5defe2a0b6f4976e967ab0227cae888a4139c0799324ca192641260fcfd7e4","observation_id":"d1f15dad-7497-4caf-aebd-1852f3a138d3","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Training Verifiers to Solve Math Word Problems, November 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:dd34af3004fc1eb1f3f26cdeb6ccfc6c90b6f4d4c2bcae5df53f85a20061a9aa","observation_id":"128752d3-1f9c-4f5f-b981-a92d58aa5802","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Let’s Verify Step by Step, May 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:28ff276a39289e6a4628ef3d40fe4b0d80905365361aa92f0dd066e5263b2f1e","observation_id":"f1bb6b44-408f-49d7-a544-9c8c132a57dd","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.02115","last_updated":"2026-05-13T21:07:49Z","snapshot_observed_at":"2026-08-01T20:59:07.888539Z","submitted_at":"2026-03-02T17:38:58Z","title":"Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.02115","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Robometer: Scaling general-purpose robotic reward models via trajectory comparisons.arXiv preprint arXiv:2603.02115, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2603.02115","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:2ad25b85aa26cd957a4ba212b9b43dd256e4bdfeaeeaadb80ab0c4ff920f5e61","observation_id":"44dc11b6-73c7-4735-befd-005e2d059244","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Topreward: Token probabilities as hidden zero-shot rewards for robotics.arXiv preprint arXiv:2602.19313, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:44e9f2480051a9d5f28f2f46d64956779af98dd8c6cbceb7a50cf50670ec40c1","observation_id":"3c6e1b83-dc0c-465b-8bd1-21eb50117013","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"RoboReward: General-purpose vision-language reward models for robotics, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:794cd17c2d3826b6f6e36896aca9dc1c1fff2b03cf6debbac878e07e0dde2065","observation_id":"fb8a223f-ef8c-4707-8c94-8c170bad9bf6","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03310","last_updated":"2023-10-14T15:52:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-05T23:32:26Z","title":"LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03310","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2306.03310","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:ab9db8dc2c2ffe99e830d4380f8afa9e5220388c07acccccf3d72d7084476720","observation_id":"f5cb24fe-f1f6-496d-aeaa-a7c04d53b76d","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15799","last_updated":"2025-06-25T19:09:52Z","snapshot_observed_at":"2026-08-08T08:13:32.220639Z","submitted_at":"2025-06-18T18:35:57Z","title":"Steering Your Diffusion Policy with Latent Space Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15799","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Steering your diffusion policy with latent space reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2506.15799","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:dbc220206c882f699e4d6cd49f205452c8d26598e421110294faa9ad41da37a6","observation_id":"be5595fb-da5a-44bc-9937-ca43e97cf601","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:bee8b926c7d0fbfd599b53594037750a1168bf6912647ecb62f06b040fe23046","observation_id":"bcb07cd1-343b-40cb-9401-c4deeb814815","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.01325","last_updated":"2022-02-15T19:09:36Z","snapshot_observed_at":"2026-08-06T19:18:51.065158Z","submitted_at":"2020-09-02T19:54:41Z","title":"Learning to summarize from human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.01325","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Ziegler, Ryan Lowe, Chelsea Voss, Alec Radford, 18 LLM-as-a-Verifier: A General-Purpose Verification Framework Dario Amodei, and Paul Christiano","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2009.01325","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:86e7c89e36c8353b927966f1161086c24c7eb0f9bd347c7bc0f8f6bbba3b1550","observation_id":"30f318c2-7c22-4f72-ae31-9b83b5d52cee","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Gemini 2.5 Flash","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:d3b342ea5e4bac07ec3d625497f5b10cc3877184f3603f5a65ddceea52bca090","observation_id":"4459bd1a-387e-4053-b86b-1f9915963925","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11868","last_updated":"2026-01-17T01:29:30Z","snapshot_observed_at":"2026-07-06T22:41:58.373427Z","submitted_at":"2026-01-17T01:29:30Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.11868","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Merrill, Alexander G","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2601.11868","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:b02d499f628a5a781ea123300204d6c0da5cb15478c73732b5f77e7297d62f4a","observation_id":"7d282e79-310d-4e78-88b5-5a15e58ec1c4","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik Narasimhan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:ffdb177d7e4116fe3e2e9348f2c0a36fc9c9b23d2ca99b23ef299f6b757de8a2","observation_id":"7b4d97d1-5cad-4b99-b130-49daa6ab34e6","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"arXiv:2310.06770 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:d9bab3a320be1ea3dce2731cf3ddb1d0632eaeb5957b2bbafc17f87411f2822c","observation_id":"7aa9590a-9cb4-4d3f-8a77-4db98162a74d","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:ed59cd1893a9ea2371ce77677c69d4e32a43681e5e3172537e4d1f6016bebca2","observation_id":"c3be7f12-5a67-4816-b980-af59e74381f0","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"URL https://www.tbench.ai/leaderboard/terminal-bench/2.0/capy-build/unknown/ gpt-5.5%40openai","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:d2ce9c1109b3e3c7844ae8202a13de1c04fc7eaf76b834c665873d31aefb3feb","observation_id":"3aca4ddd-0a53-442c-b0f2-feea30e63f2c","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"URL https://github.com/harbor-framework/terminal-bench/tree/main/ terminal_bench/agents/terminus_2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:67a4becf12917d05c2461ddb4e5c6492bb686880c638ffcbc0d31171b2904a6f","observation_id":"e5e5f8e8-0a0b-43e0-a5ed-1629c0afb394","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04549","last_updated":"2024-11-07T09:17:50Z","snapshot_observed_at":"2026-08-08T23:49:45.609026Z","submitted_at":"2024-11-07T09:17:50Z","title":"Vision Language Models are In-Context Value Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04549","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Vision language models are in-context value learners","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2411.04549","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:c90e2e380c017aeb6566e57f629297816f5c4ab44e2d0aa989086ae2adb3c520","observation_id":"27534865-1d49-4b99-b166-9facc21c7358","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"URLhttps://arxiv.org/abs/2410.24164","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:303b7109e4b5bf98dd5b9c33ea5548e0adc9432cee7ab465a3d8412a9962124f","observation_id":"b819d4be-6c06-42a2-8123-63425233c897","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:a37c8593260c73cbfc481e43dbac599a80d9f7f012c33e5bb39cfcb70dc762c1","observation_id":"bdcda714-7055-4a2e-a2a3-ecb6130f355c","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Chi, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:e5b60bcebcc41d849ba95358e4e3effc47b94e8194da202a1dc89111e7461849","observation_id":"b464b566-60bc-46e8-9b48-3048dbefe0f1","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11916","last_updated":"2023-01-29T05:14:17Z","snapshot_observed_at":"2026-08-07T04:02:08.445660Z","submitted_at":"2022-05-24T09:22:26Z","title":"Large Language Models are Zero-Shot Reasoners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11916","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Large language models are zero-shot reasoners, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2205.11916","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:1637c4dd9ba86eb48153bf559b85276da5a0619a46a5fd36f2fdded433ebfd96","observation_id":"93a2a312-e723-4b22-ac3a-a09547315ddd","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Le, and Ed H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:b701bb8f1cff04b6fadaa4ee59556939028ff347cf44b55a62d0065f14590cd3","observation_id":"1261d2b8-67f0-4493-baf7-e3dfde008ec1","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:c1d69219d4ee8c8a1723a25697c9d7354557fc38d1d74b1150699c8ee4261758","observation_id":"a63de5e2-2854-406f-bc2e-21e7271c45b4","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Tree of thoughts: Deliberate problem solving with large language models.Advances in neural information processing systems, 36:11809–11822, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:776f0ac5c543d46a97a7042bd5f8a93626702e55b9e7f0456262316cfbf14a53","observation_id":"6ebb32fa-cd53-42ee-988a-bd4621eb7695","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09687","last_updated":"2024-02-06T18:00:18Z","snapshot_observed_at":"2026-08-06T03:16:16.175894Z","submitted_at":"2023-08-18T17:29:23Z","title":"Graph of Thoughts: Solving Elaborate Problems with Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09687","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Graph of thoughts: Solving elaborate problems with large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2308.09687","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:b226294c6749696b6e79fdfa55da698756743dea33538094fbfd9169ae03c35c","observation_id":"5a6667e2-6171-4962-bdc5-b66d87e6ac1a","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"ReAct: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:7a8d535c7ea174dec09eb6913ae3d3166725fc6ab5098f661ecfd0e6c861ee14","observation_id":"4851ab17-ff44-420c-ab3f-6cc4fd0aebca","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04406","last_updated":"2024-06-06T02:51:17Z","snapshot_observed_at":"2026-08-06T23:53:10.606737Z","submitted_at":"2023-10-06T17:55:11Z","title":"Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04406","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Lan- guage agent tree search unifies reasoning acting and planning in language models.arXiv preprint arXiv:2310.04406, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2310.04406","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:d34a42c0cd587bf1275320b8e9d19f9a9d1fcffb7229389bb035bff67074c4e2","observation_id":"89204035-561d-4e1a-9817-6978bcb41109","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Reasoning with language model is planning with world model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:415e133a4d3d4d3171e4233c012109b68da3724e7497ebdb2013ba863817ae11","observation_id":"5c6911e2-e729-4c75-aaf2-6cfcd0a7e6b2","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09561","last_updated":"2023-10-19T12:24:42Z","snapshot_observed_at":"2026-08-08T23:00:32.885841Z","submitted_at":"2022-12-19T15:51:52Z","title":"Large Language Models are Better Reasoners with Self-Verification","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09561","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Large language models are better reasoners with self-verification, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2212.09561","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:62fe8f74fadcb133a56f54210e6dcb19c15248b8ad5581897065e36269874e93","observation_id":"23224799-541a-4ece-ad26-a35ac5686095","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17651","last_updated":"2023-05-25T19:13:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-30T18:30:01Z","title":"Self-Refine: Iterative Refinement with Self-Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17651","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Self-refine: Iterative refinement with self-feedback, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2303.17651","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:bc222d40b4a508f3e7daf2996f66a00bb20980cda256de499aa7c1d70d7b5166","observation_id":"0c1aaa43-7926-405a-8b3c-4c7c23411194","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11366","last_updated":"2023-10-10T05:21:45Z","snapshot_observed_at":"2026-08-10T17:44:16.302071Z","submitted_at":"2023-03-20T18:08:50Z","title":"Reflexion: Language Agents with Verbal Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11366","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Reflexion: Language agents with verbal reinforcement learning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2303.11366","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:3a34d5337c0ae2a7c593441c93a6584ea76b8c730576065cea51a43d2aff3473","observation_id":"a511c53d-c90d-4b8d-ae4c-d0b5f6237d74","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11738","last_updated":"2024-02-21T12:59:21Z","snapshot_observed_at":"2026-07-31T18:12:14.483728Z","submitted_at":"2023-05-19T15:19:44Z","title":"CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11738","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"CRITIC: Large language models can self-correct with tool-interactive critiquing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2305.11738","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:97c26895ad4b1c981442478ae22756d3b5ecccf3760435df29bc1943418837aa","observation_id":"ae0aea5a-7598-46a9-97bc-e0e3860cc188","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19457","last_updated":"2026-02-14T11:42:30Z","snapshot_observed_at":"2026-08-10T14:31:17.392776Z","submitted_at":"2025-07-25T17:42:32Z","title":"GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19457","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Agrawal, Shangyin Tan, Dilara Soylu, Noah Ziems, Rishi Khare, Krista Opsahl-Ong, Arnav Singhvi, Herumb Shandilya, Michael J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2507.19457","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:32262dd3f7fbdc3a535f9e61d60d365bc31a206ee60aaa00305b2bb2e8025153","observation_id":"5b7d6cad-5440-45f6-a52e-74e4dc9203df","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:1d661e4d3816a3381d988b27e21feb0a1e755ece41bae5f98809cbb58896c75b","observation_id":"c8b1c71e-98e0-4146-8c88-91dd8dbc4d8b","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13131","last_updated":"2025-06-16T06:37:18Z","snapshot_observed_at":"2026-08-07T04:21:43.190472Z","submitted_at":"2025-06-16T06:37:18Z","title":"AlphaEvolve: A coding agent for scientific and algorithmic discovery","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13131","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"arXiv:2506.13131 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2506.13131","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:b977c169bfa309757367994af6ca1538bece14659cb29a35380b3467376a320f","observation_id":"5fed5ba3-8612-420e-9ab8-56de02cc4b38","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Mankowitz, Esme Sutherland Robson, Pushmeet Kohli, Nando de Freitas, Koray Kavukcuoglu, and Oriol Vinyals","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:55e790fda9336c700c9d3e6656161fa85e36a91d397769b7ea5b181cdd6cf650","observation_id":"eac4cd1c-082f-4568-a1bf-2ecbec9cc440","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Le, Christopher Ré, and Azalia Mirhoseini","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:00763ad3da3a374187c6ab4f4fef85eca87bb34846ef8ec82bb94d5c4456aa78","observation_id":"abcc0918-3fa5-4e1c-8e08-62b5f903d970","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:6d3b49f6b9dfda4acedc5927c34daa68543e8e1d77e56437947fd0696d211258","observation_id":"627b1007-72fa-4503-adde-915413945a20","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Inference-aware fine-tuning for best-of-N sampling in large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:4ff4b622e83496d938bdcacd10cdb03961e480eae3baa71715354ad51cec3411","observation_id":"0e2fcb5d-9bcb-4493-b8a7-56cd062cea4d","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04166","last_updated":"2023-02-13T16:19:05Z","snapshot_observed_at":"2026-08-05T08:58:00.258106Z","submitted_at":"2023-02-08T16:17:29Z","title":"GPTScore: Evaluate as You Desire","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04166","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"GPTScore: Evaluate as you desire, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2302.04166","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:80ec91684e718f19f1f48d71762b15cde35d949e34f13d1271070c437d9cbb4e","observation_id":"b552de93-f21d-4aa0-85ec-2410ae7c14a1","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"G-eval: NLG evaluation using GPT-4 with better human alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:ad47d47b23ef02e501ea90b2041d4afdeb862088ccfe0f3f7a40f28af926555a","observation_id":"08f0cff5-7b56-4868-9730-75153130b0c3","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"doi: 10.18653/v1/2023.emnlp-main.153","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:ebcf178b6bd0e2f063e7c4e3104162d71287db7cec29b9ad8f79a576ad4ef9e5","observation_id":"90437e6d-9db6-41f6-bc6e-72552aa43ca2","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:d27f777ac316ebd3e8b749d488c6ebdce628071713a4e3291100f5b7f7add56f","observation_id":"cb498ef1-45d2-4eba-939d-6b85ae9e122c","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Hashimoto","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:1528687255a3e4e88bc0a0f6fd5224c0ef279433f2cdeb483a453d34bc4a2957","observation_id":"6da08d49-f0c8-4d45-9b3b-e5799ab1a02d","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:b6c511fa3c3b1593cdea10330daf11f1fd118a09e389c305b06d8cbe71254b64","observation_id":"2114fef4-2e7f-4078-bc10-19361bce13f5","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10928","last_updated":"2024-04-14T04:29:51Z","snapshot_observed_at":"2026-08-02T02:46:23.506253Z","submitted_at":"2023-07-20T14:56:35Z","title":"FLASK: Fine-grained Language Model Evaluation based on Alignment Skill Sets","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10928","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Flask: Fine-grained language model evaluation based on alignment skill sets.arXiv preprint arXiv:2307.10928, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2307.10928","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:5e6609690713f169d60baf2416cec42aa08370a3e45f46476b6c7334997ac321","observation_id":"85b10f22-d2c3-4088-9cb6-b95c00ee20b5","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Prometheus: Inducing fine-grained evaluation capability in language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:04fe3cd7f9d38c25c6efa09ffa90b1280755ed1dce013e71ab1af2fd3153712b","observation_id":"bb47685b-c3ea-4688-a947-2625490feec5","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:0c66474c32e47fcf9f587fc93e9bd01062e655f35538689cb041e09105564aee","observation_id":"65b118f9-6125-41c8-bc84-f3a60d53aa10","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Prometheus 2: An open source language model specialized in evaluating other language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:32edfa0ac52b4c967efb6d75c52c62a4cc070e4979ab30048dfba0b64014ef62","observation_id":"01659a7a-dfc2-40c8-a802-f63e4abeee92","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Generative judge for evaluating alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:eaf19fda7b3a749dce8409bf0e3a2efcd51119d5827ce8a495959d6bc19ed33c","observation_id":"a8142372-901f-49c6-b35e-f893e46b74cc","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18365","last_updated":"2024-10-08T02:50:41Z","snapshot_observed_at":"2026-07-06T18:37:21.973331Z","submitted_at":"2024-06-26T14:04:29Z","title":"Themis: A Reference-free NLG Evaluation Language Model with Flexibility and Interpretability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18365","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Themis: A reference-free NLG evaluation language model with flexibility and interpretability, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2406.18365","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:e68637bf84ce46e1bfa2d2d3b5fa786dd0015989cf3dd730e5ebcfab96d902d7","observation_id":"800f7d39-0df5-41c8-8f12-46c5e9f5be36","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"HD-eval: Aligning large language model evaluators through hierarchical criteria decomposition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:82962ac249946535907198dc61b39c23dd09dd3b8383094fa357b132a257401a","observation_id":"77cb4c56-63d1-42b1-bc9a-60a61b1a228d","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"PandaLM:An automaticevaluationbenchmarkforLLMinstructiontuningoptimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:a47bc7315ba307741e084c09d3e61861824acce6202a5dd4912d80383b1ea581","observation_id":"d4c50f9e-03c3-43fa-bebf-da7e2fa5774f","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"JudgeLM: Fine-tuned large language models are scalable judges","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:9c64b67eae6b6b16a458d54ff2542fc23d6e332547ea87742c5007f48b6df743","observation_id":"a299f0a0-01d0-4b89-bc8a-1a76daf7d99e","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07201","last_updated":"2023-08-14T15:13:04Z","snapshot_observed_at":"2026-08-02T01:34:38.978920Z","submitted_at":"2023-08-14T15:13:04Z","title":"ChatEval: Towards Better LLM-based Evaluators through Multi-Agent Debate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07201","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Chateval: Towards better llm-based evaluators through multi-agent debate.arXiv preprint arXiv:2308.07201, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2308.07201","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:faddbba869a305533b0be7f4317a7411c90f08d527aeed8e4e26f2919c384873","observation_id":"bf80e6ca-8834-4c90-9157-c6afb65304d1","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Shrinking the generation-verification gap with weak verifiers.arXiv preprint arXiv:2506.18203, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:4065ea3c0a977861c0a38b4ee302b10527bba6e4bb2a0ea65f4316f170174d61","observation_id":"a5f1939b-7dbc-4939-b18d-c5fc4bb213c7","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Large language models are not fair evaluators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:67407f0faef51043e676948109afdc8de4e4e634e901c9d1a11589ce8f3ad212","observation_id":"460285ab-49af-43f7-b100-9b5bc651eb03","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Evaluating large language models at evaluating instruction following","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:c09ca61c9970d6758e027825acffef1ede60efac1f829cd14bf7eea323c35698","observation_id":"481c9dfb-0f74-4efd-961b-865f2bfc1593","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Benchmarking cognitive biases in large language models as evaluators, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:f97651de5cf7910eede6b5c2139000c0834f564a68c8a9bcdd3e87d9e3b9c216","observation_id":"c9b73bbf-03de-4ba3-b178-d538abc065d4","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09766","last_updated":"2024-06-07T09:41:36Z","snapshot_observed_at":"2026-08-04T10:35:44.012115Z","submitted_at":"2023-11-16T10:43:26Z","title":"LLMs as Narcissistic Evaluators: When Ego Inflates Evaluation Scores","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09766","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"LLMs as narcissistic evaluators: When ego inflates evaluation scores, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2311.09766","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:1bab4c316927d7f8a5c3cea8f4631bb5131f5be63c557859e27bd18f746e0f48","observation_id":"9d903bc7-1671-45df-82a5-b0383e87779d","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"JudgeBench: A benchmark for evaluating LLM-based judges","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:8c2dc7f39325f52de33b4a00a2e458b2471b79fa3b795f32a1280a0a2876a2be","observation_id":"c1c3fb45-03e1-47ed-b3fb-afb656ed1620","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"An empirical study of LLM-as-a-judge for LLM evaluation: Fine-tuned judge model is not a general substitute for GPT-4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:3500564f1bba4e287745707a4ee33dc15d5d32b449334536353f57668e2f028f","observation_id":"bad1870f-e62a-4db5-8c05-5f4d3eaa0e89","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.10535","last_updated":"2025-08-14T17:58:50Z","snapshot_observed_at":"2026-08-09T16:40:01.179500Z","submitted_at":"2025-07-14T17:56:29Z","title":"CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.10535","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2507.10535","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:b4041becceff7fdc0ef94853c5805043a279ac4a6274af09936638753033c8ba","observation_id":"b7a9f655-9f30-4eb0-99d8-c68ab6d5b659","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04788","last_updated":"2024-06-11T06:21:46Z","snapshot_observed_at":"2026-08-05T04:13:25.261876Z","submitted_at":"2024-02-07T12:28:32Z","title":"MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04788","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"MLLM-as-a-judge: Assessing multimodal LLM-as-a-judge with vision-language benchmark, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2402.04788","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:7a55c0ac795414dbd5fac44a5547ab28945116747b22e18b4a066adbee427f0f","observation_id":"7fe4ef8e-7ef3-4cbb-90fe-4457cebebf50","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06591","last_updated":"2024-01-12T14:19:23Z","snapshot_observed_at":"2026-08-10T07:33:06.680315Z","submitted_at":"2024-01-12T14:19:23Z","title":"Prometheus-Vision: Vision-Language Model as a Judge for Fine-Grained Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06591","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Prometheus-vision: Vision-language model as a judge for fine-grained evaluation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2401.06591","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:345736fcfee4806f94fe7a42aecbdc6c6d35c47b861a8cb2a06ac7a2cbb4f37c","observation_id":"e071b0f0-db76-401f-adcb-695c60fd0a31","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02712","last_updated":"2025-03-04T00:49:07Z","snapshot_observed_at":"2026-08-09T22:43:34.534202Z","submitted_at":"2024-10-03T17:36:33Z","title":"LLaVA-Critic: Learning to Evaluate Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02712","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"LLaVA-critic: Learning to evaluate multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2410.02712","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:64e4098861bc60bde1c7303ec7bacb47463568f0247349c05150c84f49840391","observation_id":"ad819da2-2bf2-4957-82d1-61e88aafbb35","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Solving math word problems with process- and outcome-based feedback, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:13ae9f930af0469095d02ef0851bfcf02aaf7280a06522aaa47350b7823c8ff4","observation_id":"8c93d45e-0469-49ea-ba6d-17f975c76af1","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"VIP: Towards universal visual reward and representation via value-implicit pre-training,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:6d89264bf8137c41fee19bb5df816c677200a7a98ded405461eff2585e4e25fc","observation_id":"2a02f34b-4e62-4d4a-9c0c-f39f55067a6f","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.00030","last_updated":"2023-03-07T02:29:59Z","snapshot_observed_at":"2026-08-02T00:17:16.761436Z","submitted_at":"2022-09-30T18:14:07Z","title":"VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.00030","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"23 LLM-as-a-Verifier: A General-Purpose Verification Framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2210.00030","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:5226aa21b0ddfe0e459b631d4f23274f7bc1aa2d956cc396845c752683da977f","observation_id":"1310acd4-f87e-4717-a0dd-aec57ce9dfdb","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00958","last_updated":"2023-06-01T17:52:23Z","snapshot_observed_at":"2026-08-06T20:32:01.174179Z","submitted_at":"2023-06-01T17:52:23Z","title":"LIV: Language-Image Representations and Rewards for Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00958","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"LIV: Language-image representations and rewards for robotic control, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2306.00958","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:de7cec17e0b716d3bd800614c31c07f295e3f1dd6a5191720e98b371d042cc72","observation_id":"a68434fb-7d6f-49c6-b07d-c8c18e3f2a6a","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Sontakke, Jesse Zhang, Sébastien M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:e62c927c78c0ba7e22a22d4cd0c95f079281a6f6282ab3103ee76f3193d19a05","observation_id":"81243133-fb41-45de-8cc8-fca2b085034b","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07899","last_updated":"2023-10-11T21:10:21Z","snapshot_observed_at":"2026-08-07T12:50:27.325576Z","submitted_at":"2023-10-11T21:10:21Z","title":"RoboCLIP: One Demonstration is Enough to Learn Robot Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07899","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2310.07899","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:9a9096092a9576b9ecd191a310af44774abac3136c0355d751fa6ce3dba8fc35","observation_id":"afa61f81-4c7d-4877-8f5b-10580d8c0c8f","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-09T02:27:34.397358Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Vision- language models are zero-shot reward models for reinforcement learning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:dd2f99e3d5fc2e24bfff42299c7445fd796ca19ee272afae0d38df488ff372e6","observation_id":"d27b0c92-b711-49ec-a398-c26a00ba82a1","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-02T19:29:16.535750Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"RL-VLM-F: Reinforcement learning from vision language foundation model feedback, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:bcf84b7110e932a3dbe4685c8a896989bdf1c91ade55a3fd6cc9afb2197b4508","observation_id":"2159aea4-c9d6-488c-bf68-f1ac3e07fd84","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08647","last_updated":"2023-06-16T23:02:21Z","snapshot_observed_at":"2026-08-07T14:05:45.642543Z","submitted_at":"2023-06-14T17:27:10Z","title":"Language to Rewards for Robotic Skill Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08647","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Language to rewards for robotic skill synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2306.08647","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:188a524aa97632f0f8bda56d345218bad90890d5647b691d434c2516648ce696","observation_id":"0e5994b9-f181-4ccf-8356-9aeb00c7c3af","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Text2Reward: Reward shaping with language models for reinforcement learning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:3c416a0d9cf8be358b8eb4960423911a61f1fb84ab92a2fe60afa1120a3f59a4","observation_id":"452ca998-7168-4afb-8c1e-428707d1d97f","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12931","last_updated":"2024-04-30T21:35:53Z","snapshot_observed_at":"2026-08-02T10:40:03.816188Z","submitted_at":"2023-10-19T17:31:01Z","title":"Eureka: Human-Level Reward Design via Coding Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12931","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Eureka: Human-level reward design via coding large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2310.12931","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:71f0ae065dceb8e8ae1600956f399dbe3c5d97ba34db48bcb742b598849670fc","observation_id":"0172d717-a7b0-4903-b8a0-27daae6f082d","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Lim, Jesse Thomason, Erdem Biyik, and Jesse Zhang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:f41910e3b57af99999ea8c956c3d6c7f0ebcc98288d0b40b35047a8e48ba75e8","observation_id":"8f8f2769-e3e1-425b-b199-90a7a0b636e9","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.25358","last_updated":"2026-04-27T02:56:51Z","snapshot_observed_at":"2026-07-06T22:31:10.099674Z","submitted_at":"2025-09-29T18:07:54Z","title":"SARM: Stage-Aware Reward Modeling for Long Horizon Robot Manipulation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.25358","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"SARM: Stage-aware reward modeling for long horizon robot manipulation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2509.25358","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:633a829367166b84e3b6c4e937f31c6650e482ea03aaec1a7c8053e0ac8e27bd","observation_id":"7362ffb4-624c-4e66-8651-8578f6e79d9c","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13816","last_updated":"2025-02-24T21:05:58Z","snapshot_observed_at":"2026-08-05T20:44:16.574781Z","submitted_at":"2024-10-17T17:46:26Z","title":"Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13816","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Steering your generalists: Improving robotic foundation models via value guidance, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2410.13816","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:ce32ed6a608f52e15af38b43c1ffa5cb80ec0ae71fe4a7acadacc60ea7a6c139","observation_id":"d644c3bd-b56f-4e03-93a7-2505c60d8a8c","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.17355","last_updated":"2025-04-25T17:27:10Z","snapshot_observed_at":"2026-08-06T16:07:46.580235Z","submitted_at":"2024-08-30T15:39:34Z","title":"Bidirectional Decoding: Improving Action Chunking via Guided Test-Time Sampling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.17355","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Bidirectional decoding: Improving action chunking via guided test-time sampling, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2408.17355","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:d5ce7bbcc0985f06d474963e1161d880ba0f6fd96ac2e54848fbaeb5aa814cd0","observation_id":"e3eb01b9-be0d-4184-b697-e308253d8c17","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"RoboMonkey: Scaling test-time sampling and verification for vision-language- action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:8e64432db9c5e646563864a745c27c65112c8602e53b9c4c06230b4dc7f00442","observation_id":"f30661cf-cd98-40ae-8a34-d91f52a39059","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04640","last_updated":"2024-10-10T17:09:24Z","snapshot_observed_at":"2026-08-06T19:36:26.011619Z","submitted_at":"2024-10-06T22:13:30Z","title":"Unpacking Failure Modes of Generative Policies: Runtime Monitoring of Consistency and Progress","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04640","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Unpacking failure modes of generative policies: Runtime monitoring of consistency and progress, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2410.04640","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:7a6f3fe26261f96816bc5cc432696ab0d0a87e382b85302a30f7ec1acc004dc5","observation_id":"b32664f1-d036-4651-88f2-b39bacacde24","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Scaling verification can be more effective than scaling policy learning for vision-language- action alignment, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:dcf25080238cbef2d382901317b57739aeb70d8a1c0811d041c211bd251a13f2","observation_id":"29bdb0e4-9944-4d43-994c-52f6a0ad8a66","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14251","last_updated":"2023-10-11T05:27:50Z","snapshot_observed_at":"2026-08-01T16:29:58.693560Z","submitted_at":"2023-05-23T17:06:00Z","title":"FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14251","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"FActScore: Fine-grained atomic evaluation of factual precision in long form text generation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2305.14251","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:bcb1721ceb41d579bc7390cc19b1536077d45f43f49e0841dc23fe40957118ad","observation_id":"2fdc84d5-7da1-49ee-bff1-d66f2c67b25a","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08542","last_updated":"2022-04-29T16:02:14Z","snapshot_observed_at":"2026-08-06T15:05:15.035432Z","submitted_at":"2021-12-16T00:38:35Z","title":"QAFactEval: Improved QA-Based Factual Consistency Evaluation for Summarization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08542","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Fabbri, Chien-Sheng Wu, Wenhao Liu, and Caiming Xiong","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2112.08542","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:b6052497d4f9983e846574483f3f87d7a4dfff94b9c1f881aba9082ea57a0ade","observation_id":"726055b4-c0ff-4fc2-b31b-00150c257451","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08896","last_updated":"2023-10-11T17:43:28Z","snapshot_observed_at":"2026-07-06T15:03:55.982628Z","submitted_at":"2023-03-15T19:31:21Z","title":"SelfCheckGPT: Zero-Resource Black-Box Hallucination Detection for Generative Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08896","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2303.08896","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:293755e0a7f10fea89842b562d863413f1fb4d9ae8c7a7a650f12a112c52d369","observation_id":"d09b7fde-c598-4851-98a9-1d61244a3156","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.01985","last_updated":"2026-05-29T16:27:50Z","snapshot_observed_at":"2026-07-13T14:05:19.455452Z","submitted_at":"2026-04-02T12:48:36Z","title":"World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.01985","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"World action verifier: Self-improving world models via forward-inverse asymmetry, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2604.01985","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:b3dce5bb90efb1e7715ce191e8085d76ce8e021226a8a6df28138b00abb5c191","observation_id":"737ecf2c-6276-4a63-a36c-64a89a504146","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.18610","last_updated":"2026-06-26T17:59:04Z","snapshot_observed_at":"2026-08-08T09:10:50.377259Z","submitted_at":"2026-06-17T02:15:46Z","title":"SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.18610","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"A” position and one “B","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2606.18610","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:06e6e86415b2ee7c504b6debbff738137e1d047cf9ce576f0b2c2c70d3eff627","observation_id":"295e4766-fdcb-47ea-9d6d-291d7fd652fc","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework"},"reference_resolution":{"displayed":95,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":94,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":95},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 95 of 95 outbound references and 5 inbound Pith citation observations for arXiv:2607.05391."}