{"as_of":"2026-08-10T10:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:42a0c05240a65bb3303e01f0d8dbd17be52dc2ff2eaeaeca71b4b6fa874f8198","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:03:59.969588Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.08965/citation-record","integrity":"/paper/2506.08965/integrity","json":"/paper/2506.08965/citation-record.json","paper":"/paper/2506.08965"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:00.804158Z","title":null,"venue":null,"work_id":"72d9b4b5-723f-4edc-b5da-eb106f8cb193","year":null},"citing_paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","snapshot_observed_at":"2026-08-10T02:46:43.663063Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:59.629212Z"},"links":{"citing_paper":"/paper/2506.08965"},"observation_digest":"sha256:d4a5540bff6b28fa5adc91257ca5c260932ac2faf25228dc29170faabe45da0a","observation_id":"03fe4b88-0c49-479c-a137-bec123b343a1","resolution":{"observed_at":"2026-08-07T05:04:00.872967Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:00.649665Z","title":"strong signal","venue":null,"work_id":"c9a19b24-25ab-4ff8-ba85-d99556ee610b","year":null},"citing_paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","snapshot_observed_at":"2026-08-10T02:46:43.663063Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:59.701979Z"},"links":{"citing_paper":"/paper/2506.08965"},"observation_digest":"sha256:aeb41a1a494e45cfa706ccbc4f37b34616034b565d23092b02846902aa25bcb0","observation_id":"76d43501-a5be-4718-a772-01626ecea597","resolution":{"observed_at":"2026-08-07T05:04:00.712230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:00.230703Z","title":"Weak Accept or Strong Reject vs","venue":null,"work_id":"749dd006-3b41-4112-9a14-245100bc547f","year":null},"citing_paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","snapshot_observed_at":"2026-08-10T02:46:43.663063Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:59.969588Z"},"links":{"citing_paper":"/paper/2506.08965"},"observation_digest":"sha256:8bcbc562507202e68a4aebc456b14974b38d6cb9f4601a9ff5e4cd80a6e1b17b","observation_id":"45c4b94b-5f19-4f9b-8836-fea49deded49","resolution":{"observed_at":"2026-08-07T05:04:00.271775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12832","last_updated":"2024-10-02T17:58:39Z","snapshot_observed_at":"2026-08-03T10:06:52.418096Z","submitted_at":"2024-10-02T17:58:39Z","title":"Generative Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12832","snapshot_observed_at":"2026-08-07T05:03:59.316747Z","title":"arXiv preprint arXiv:2410.12832","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","snapshot_observed_at":"2026-08-10T02:46:43.663063Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:59.316747Z"},"links":{"cited_paper":"/paper/2410.12832","citing_paper":"/paper/2506.08965"},"observation_digest":"sha256:a3f40ea4b7251e6799e634eb596f98683ff949ab1d33f3e1f0e41f0f7876a702","observation_id":"e7bb3a19-2414-47b3-bf2d-6a8c61a5c1b6","resolution":{"observed_at":"2026-08-07T05:03:59.316747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03742","last_updated":"2024-10-13T10:21:29Z","snapshot_observed_at":"2026-07-06T19:28:01.764884Z","submitted_at":"2024-10-01T07:38:58Z","title":"Beyond Scalar Reward Model: Learning Generative Judge from Preference Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03742","snapshot_observed_at":"2026-08-07T05:03:59.531765Z","title":"strong accept","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","snapshot_observed_at":"2026-08-10T02:46:43.663063Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:59.531765Z"},"links":{"cited_paper":"/paper/2410.03742","citing_paper":"/paper/2506.08965"},"observation_digest":"sha256:d486c1ae70b07a341402b9731be42e1c32234c6e4c07d9f86bd045e43ffc17f1","observation_id":"0346ca06-8dc5-42b6-8bac-5b01371268fd","resolution":{"observed_at":"2026-08-07T05:03:59.531765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:00.496354Z","title":"The model thus converges to an optimal solu- tion consistent with the true preference order- ing (up to an additive scaling)","venue":null,"work_id":"8dc8aed5-9464-41f4-b4bc-3436b9d93b69","year":null},"citing_paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","snapshot_observed_at":"2026-08-10T02:46:43.663063Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:59.800755Z"},"links":{"citing_paper":"/paper/2506.08965"},"observation_digest":"sha256:5782ac18a5e9fcd0ae589281e0272277b252eef452dcd2faa93b2ba34173b340","observation_id":"6921bfe3-fb3a-4a1c-9b50-f04875cc2178","resolution":{"observed_at":"2026-08-07T05:04:00.559616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:00.355336Z","title":"This retains the positive gradient properties 14 of logistic log-likelihood, allowing standard optimizers to converge efficiently","venue":null,"work_id":"915d3ba2-cee5-43f5-9ce2-55c7b0d307bc","year":null},"citing_paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","snapshot_observed_at":"2026-08-10T02:46:43.663063Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:59.861614Z"},"links":{"citing_paper":"/paper/2506.08965"},"observation_digest":"sha256:01cf4447d4e42fb4c66600362a30e77b541338d79cb952d946e299a0dfd55c48","observation_id":"0d90e109-0ec1-4a4d-a75e-8c517cb91d5b","resolution":{"observed_at":"2026-08-07T05:04:00.426144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T05:03:59.448741Z","title":"Jeff Rasley, Samyam Rajbhandari, Olatunji Ruwase, and Yuxiong He","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","snapshot_observed_at":"2026-08-10T02:46:43.663063Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:59.448741Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.08965"},"observation_digest":"sha256:fc7fe90516929e34e0d0aa499e3c75cb2cba77a030f5a5c48a8e82b007e321e6","observation_id":"7e971c68-9613-45c3-98c3-6249acb37590","resolution":{"observed_at":"2026-08-07T05:03:59.448741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-08T09:03:25.135475Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-07T05:03:59.265968Z","title":"In Proceedings of the Workshop on Speech and Natural Language, pages 103–108","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","snapshot_observed_at":"2026-08-10T02:46:43.663063Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO","version":1},"reference_index":1992,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:59.265968Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2506.08965"},"observation_digest":"sha256:c47516d8a235b819ebe235bea51afbf17c0621b010479fc1cf5ae4fc05ec8702","observation_id":"93599e44-d838-4697-8c2d-62358cf345b5","resolution":{"observed_at":"2026-08-07T05:03:59.265968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-07T05:03:59.109692Z","title":"arXiv preprint arXiv:2112.00861","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","snapshot_observed_at":"2026-08-10T02:46:43.663063Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:59.109692Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2506.08965"},"observation_digest":"sha256:c595dfbe7ed406bbffec96c5125c1a09e374b454ba22d140759d717cc0889f5c","observation_id":"0a49f408-87ef-4be4-8efc-4928a420e7ba","resolution":{"observed_at":"2026-08-07T05:03:59.109692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T05:03:59.185692Z","title":"arXiv preprint arXiv:2203.02155","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","snapshot_observed_at":"2026-08-10T02:46:43.663063Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:59.185692Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2506.08965"},"observation_digest":"sha256:bd89400be9affad7e5cdf5aab37ae44c5ba506be39a5d33e64c905e807f171bc","observation_id":"c48772e5-ded9-4861-8e38-87baf9bd560c","resolution":{"observed_at":"2026-08-07T05:03:59.185692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:00.941842Z","title":"Samyam Rajbhandari, Jeff Rasley, Olatunji Ruwase, and Yuxiong He","venue":null,"work_id":"a9a43f18-1b6d-451c-a911-d19e43d01f30","year":2020},"citing_paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","snapshot_observed_at":"2026-08-10T02:46:43.663063Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:59.380040Z"},"links":{"citing_paper":"/paper/2506.08965"},"observation_digest":"sha256:919ef7a48a003cdfb64ce582dfcd425efd5420220e79176d8d89be732b661289","observation_id":"98fe3752-c817-4a50-880f-dea6985cabb7","resolution":{"observed_at":"2026-08-07T05:04:01.019646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-08-10T02:45:59.371931Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-07T05:03:59.046421Z","title":"arXiv preprint arXiv:2408.11791","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","snapshot_observed_at":"2026-08-10T02:46:43.663063Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:59.046421Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2506.08965"},"observation_digest":"sha256:2f8ec448a6ce85e00f0eefc82882dfb85dee3c509fdcd97cd907282f897dd1ef","observation_id":"717b82e3-abeb-4939-8f27-cbe14a2d3d99","resolution":{"observed_at":"2026-08-07T05:03:59.046421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T02:46:43.663063Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2506.08965."}