{"as_of":"2026-08-19T06:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:265a09a66a519e11c946f2641a92f5ec0a49d1817c66c1c1d2aa3231fdda79a8","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:02:53.986004Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T22:50:33.128296Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T22:27:26.359636Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20417","snapshot_observed_at":"2026-08-07T22:50:33.128296Z","title":"Scar: Shapley credit assignment for more efficient rlhf","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.09053","last_updated":"2025-08-05T02:23:31Z","snapshot_observed_at":"2026-08-15T19:20:27.516820Z","submitted_at":"2025-02-13T08:08:27Z","title":"Game Theory Meets Large Language Models: A Systematic Survey with Taxonomy and New Frontiers","version":2},"reference_index":124,"source":"pdf_text","source_observed_at":"2026-08-07T22:50:33.128296Z"},"links":{"cited_paper":"/paper/2505.20417","citing_paper":"/paper/2502.09053"},"observation_digest":"sha256:c6fb8b0e34e1582f0bf5646e61370a20ba8b03776f7b42ccb598b874af7586d5","observation_id":"619b6d7f-1445-49bd-87e2-8a004485d264","resolution":{"observed_at":"2026-08-07T22:50:33.128296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20417","snapshot_observed_at":"2026-08-03T22:48:12.321881Z","title":"Javier Castro, Daniel G´omez, and Juan Tejada","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2511.10687","last_updated":"2026-07-01T23:47:17Z","snapshot_observed_at":"2026-08-16T01:47:59.699882Z","submitted_at":"2025-11-11T22:21:08Z","title":"Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T22:48:12.321881Z"},"links":{"cited_paper":"/paper/2505.20417","citing_paper":"/paper/2511.10687"},"observation_digest":"sha256:9e6233b22a01eed1e6877b2c5e54898f5432d7415591ac59dd2911fe776ffa93","observation_id":"6fa6716e-04e7-41c2-a61f-c2dcbd4576e4","resolution":{"observed_at":"2026-08-03T22:48:12.321881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"cited_work":{"arxiv_id":"2505.20417","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20417","snapshot_observed_at":"2026-07-02T22:27:26.359636Z","title":"Scar: Shapley credit assignment for more efficient rlhf.arXiv preprint arXiv:2505.20417","venue":null,"work_id":"cc340c66-6fdc-4882-851f-3e72d0c1f64e","year":null},"citing_paper":{"arxiv_id":"2604.09459","last_updated":"2026-08-09T14:06:24Z","snapshot_observed_at":"2026-08-15T05:17:57.940786Z","submitted_at":"2026-04-10T16:17:44Z","title":"From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T17:09:36.341574Z"},"links":{"cited_paper":"/paper/2505.20417","citing_paper":"/paper/2604.09459"},"observation_digest":"sha256:4e3a89d47bab35563c6ad27797ab82cebf703508ac28fd105726f1dbac7b212e","observation_id":"8960c0f9-2673-479a-ae7b-632506a527a7","resolution":{"observed_at":"2026-05-11T07:30:58.332657Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"cited_work":{"arxiv_id":"2505.20417","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20417","snapshot_observed_at":"2026-07-02T22:27:26.359636Z","title":"Scar: Shapley credit assignment for more efficient rlhf.arXiv preprint arXiv:2505.20417","venue":null,"work_id":"cc340c66-6fdc-4882-851f-3e72d0c1f64e","year":null},"citing_paper":{"arxiv_id":"2606.00257","last_updated":"2026-05-29T18:42:06Z","snapshot_observed_at":"2026-08-16T13:02:47.619773Z","submitted_at":"2026-05-29T18:42:06Z","title":"ARCA: Adapter-Residual Credit Assignment When Token Signals Degenerate","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-28T22:54:53.415067Z"},"links":{"cited_paper":"/paper/2505.20417","citing_paper":"/paper/2606.00257"},"observation_digest":"sha256:8795c2b35b53efc8edf0be8ba20f2a74ccb234e5eaa33b67d3b433b7839c261e","observation_id":"cf666e19-0e8c-438b-bb20-cd208cea4c1f","resolution":{"observed_at":"2026-07-01T19:16:00.834043Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"cited_work":{"arxiv_id":"2505.20417","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20417","snapshot_observed_at":"2026-07-02T22:27:26.359636Z","title":"Scar: Shapley credit assignment for more efficient rlhf.arXiv preprint arXiv:2505.20417","venue":null,"work_id":"cc340c66-6fdc-4882-851f-3e72d0c1f64e","year":null},"citing_paper":{"arxiv_id":"2606.09932","last_updated":"2026-06-07T17:58:58Z","snapshot_observed_at":"2026-08-13T23:07:04.214760Z","submitted_at":"2026-06-07T17:58:58Z","title":"When RL Fails after SFT: Rejuvenating Model Plasticity for Robust SFT-to-RL Handoff","version":1},"reference_index":140,"source":"arxiv_source","source_observed_at":"2026-06-27T18:49:47.876179Z"},"links":{"cited_paper":"/paper/2505.20417","citing_paper":"/paper/2606.09932"},"observation_digest":"sha256:a0bd250fd250ef7a98a042e15d2a4ee0a01d58c8a6f1f9d07a4a02c84226ff10","observation_id":"1f7f29c1-b6aa-4e99-aa72-7a6820d4e224","resolution":{"observed_at":"2026-07-02T22:27:26.361615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20417","snapshot_observed_at":"2026-08-02T13:58:43.421940Z","title":"Scar: Shapley credit assignment for more efficient rlhf.arXiv preprint arXiv:2505.20417, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18258","last_updated":"2026-05-15T09:09:57Z","snapshot_observed_at":"2026-08-15T02:29:53.498306Z","submitted_at":"2026-05-15T09:09:57Z","title":"S2T-RLHF: Hierarchical Credit Assignment for Stable Preference-Based RLHF","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T13:58:43.421940Z"},"links":{"cited_paper":"/paper/2505.20417","citing_paper":"/paper/2607.18258"},"observation_digest":"sha256:0132e0028bc9f23b419ad972f5721829d72235926db6c6719691b61d7f92d75a","observation_id":"033c1848-ef05-4e5d-80ec-ad830e59491a","resolution":{"observed_at":"2026-08-02T13:58:43.421940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20417","snapshot_observed_at":"2026-08-05T00:40:08.337752Z","title":"arXiv preprint arXiv:2505.20417","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00584","last_updated":"2026-08-01T10:45:03Z","snapshot_observed_at":"2026-08-16T14:52:52.781341Z","submitted_at":"2026-08-01T10:45:03Z","title":"Element-Aware Group Learning for E-Commerce Image Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T00:40:08.337752Z"},"links":{"cited_paper":"/paper/2505.20417","citing_paper":"/paper/2608.00584"},"observation_digest":"sha256:ada7550d94821cf8afb30fd5e1f48441534be39a688ad0c979ea878fe9f82737","observation_id":"9b46fde3-7666-4fc7-9a59-dc7a74bc6b9d","resolution":{"observed_at":"2026-08-05T00:40:08.337752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20417/citation-record","integrity":"/paper/2505.20417/integrity","json":"/paper/2505.20417/citation-record.json","paper":"/paper/2505.20417"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:01.544853Z","title":"Cooperative games with coalition structures.International Journal of game theory, 3:217–237, 1974","venue":null,"work_id":"1249cab1-c148-47ae-aafb-c2482d7208c2","year":1974},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:44.206812Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:d60798425b5fbc5951bbceef045af814a74512f250725c83c57a1f311618bd68","observation_id":"93a28207-45ea-4c27-82c9-c496b2345950","resolution":{"observed_at":"2026-08-07T14:03:01.651342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:01.410660Z","title":"An actor-critic algorithm for sequence prediction","venue":null,"work_id":"6bcb4ffe-8c3a-438e-b2ae-af561fe3545a","year":2017},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:44.270024Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:00c57dd4db469dc0dfaffbe121459bdfe77c459aa6f7c398b46d9b2571b1fad2","observation_id":"b7dc906d-390f-49f4-ad9f-c7e1ac83c4aa","resolution":{"observed_at":"2026-08-07T14:03:01.473380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T14:02:44.385936Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback.arXiv preprint arXiv:2204.05862, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:44.385936Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:dc7ce045797f68660f73ccf158d95f6290c9caac4ec52b204ba7c25e1d89ac12","observation_id":"16a1f1bc-5379-46a6-8497-db378f42cd70","resolution":{"observed_at":"2026-08-07T14:02:44.385936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:01.153467Z","title":"Unifying count-based exploration and intrinsic motivation","venue":null,"work_id":"4dff3743-6f85-4e0b-a563-7216dc252f2a","year":2016},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:44.465760Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:455c1a9fdf5e74c290ad69804f32eb3fb717ee83345970c2411aa483f3987a70","observation_id":"65f877f9-1128-41a4-b173-02d16aed082c","resolution":{"observed_at":"2026-08-07T14:03:01.248732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:44.535260Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:44.535260Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:b62a5061c0c43a5c7c05e08631d85da6c6ace740646fae30957a627eaa29897a","observation_id":"86571453-5e38-4dac-aa1e-515a88c7e1be","resolution":{"observed_at":"2026-08-07T14:02:44.535260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:00.910047Z","title":"Language models are few-shot learners","venue":null,"work_id":"c7562bcf-e805-4c66-8842-e7896eda0e33","year":1901},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:44.869712Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:db2157e98617ad161fade921ce9944a6353473264477a3b0840395bdd379761d","observation_id":"1f9d92d6-8e4e-4b4d-afcb-8a46a38f7bd1","resolution":{"observed_at":"2026-08-07T14:03:01.003349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:00.708414Z","title":"Ask the right questions: Active question reformulation with reinforcement learning","venue":null,"work_id":"907f1b15-0880-4c03-836e-58fd9ef6e5b7","year":2018},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:46.280666Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:9b3b95dd188c4c44d35d3b2182a4e3cbe5141e122fa73acdf85bacc8e2998bd8","observation_id":"a8f90ea3-32e2-4385-8b64-fc512ace053e","resolution":{"observed_at":"2026-08-07T14:03:00.801805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:00.570855Z","title":"Enhancing reinforcement learning with dense rewards from language model critic","venue":null,"work_id":"fc6083a5-9866-4aa1-938d-77393d594fb7","year":2024},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:46.500681Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:66b8b9784b2dc63704af2392423df16ed2baf86417f4188a7465e5e9810808a3","observation_id":"18cb1723-1f98-4958-bcc1-4c7412ce00c7","resolution":{"observed_at":"2026-08-07T14:03:00.612613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:00.401737Z","title":"Dense reward for free in reinforcement learning from human feedback","venue":null,"work_id":"f142201e-b5c4-44cc-a1ec-78cc41dbd05d","year":2024},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:48.421286Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:4ea7a4cb6f64e0466576483ba3360c93859c9c0f29999109d56e076ac43d2bc5","observation_id":"6c1b17a7-a780-406c-a64b-40a90f983198","resolution":{"observed_at":"2026-08-07T14:03:00.525456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:00.183670Z","title":"Deep reinforcementlearningfromhumanpreferences","venue":null,"work_id":"210198a8-8689-464b-9b3a-1eeb107e2659","year":2017},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:48.558895Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:a49d4c63f4be2011afb0c18d3d3120a04556504143e8db935082545897ed2182","observation_id":"fcb1f168-f636-4714-8814-808d94e3bd8d","resolution":{"observed_at":"2026-08-07T14:03:00.271101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-07T14:02:48.630129Z","title":"Raft: Reward ranked finetuning for generative foundation model alignment.arXiv preprint arXiv:2304.06767, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:48.630129Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:b6ef6fe04c129c21cde5b3b4f1913fcfae3c1411cf5f9f44d9d437f46dbb76bf","observation_id":"3fe0eff9-d9f5-4570-aa71-86c8e849f1e6","resolution":{"observed_at":"2026-08-07T14:02:48.630129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:48.696395Z","title":"Openllama: An open reproduction of llama, May 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:48.696395Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:59b01e8ebbe91713a2f759699b8ff489962a4f6fb81b2eb8463cd36bda80d61e","observation_id":"5daf9793-6240-42d7-a356-d1543e156e40","resolution":{"observed_at":"2026-08-07T14:02:48.696395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:59.964472Z","title":"Transformer feed-forward layers build predictions by promoting concepts in the vocabulary space","venue":null,"work_id":"5788bd23-0d39-425f-8c1e-602ff505b098","year":2022},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:48.774023Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:2499ce706a2af492e03758c2a47d74398b2e85e5aaee0d04f7fe0ca74c363b10","observation_id":"8296700f-95dd-4ec6-8f94-59f15666e962","resolution":{"observed_at":"2026-08-07T14:03:00.083032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10114","last_updated":"2024-07-22T08:59:07Z","snapshot_observed_at":"2026-08-18T13:42:23.039004Z","submitted_at":"2024-07-14T08:07:50Z","title":"TokenSHAP: Interpreting Large Language Models with Monte Carlo Shapley Value Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10114","snapshot_observed_at":"2026-08-07T14:02:48.997944Z","title":"Tokenshap: Interpreting large language models with monte carlo shapley value estimation.arXiv preprint arXiv:2407.10114, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:48.997944Z"},"links":{"cited_paper":"/paper/2407.10114","citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:f80a2a65eba2fddce7966860bf5aa578437a9e5b160bca8028ef706653a5a1b4","observation_id":"84fbbc30-e86c-4816-b44e-6a58d97433d2","resolution":{"observed_at":"2026-08-07T14:02:48.997944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:59.752448Z","title":"A duality approach for regret minimization in average-award ergodic markov decision processes","venue":null,"work_id":"b669de9b-7d47-43c8-9234-d5e6cc845aab","year":2020},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:49.095847Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:98f24780bbe7b43240e74a9e123006e7a4cc282a877683372e314150709d96ca","observation_id":"265f0e68-e43a-494b-a39d-2ad998bff0c9","resolution":{"observed_at":"2026-08-07T14:02:59.821807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.09281","last_updated":"2019-11-11T14:18:31Z","snapshot_observed_at":"2026-08-14T00:33:35.701152Z","submitted_at":"2019-10-21T12:06:28Z","title":"Dealing with Sparse Rewards in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.09281","snapshot_observed_at":"2026-08-07T14:02:49.225204Z","title":"Dealing with sparse rewards in reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:49.225204Z"},"links":{"cited_paper":"/paper/1910.09281","citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:a36f780d2434faa5973ff2c08dadb38c1a460e10109c1a36d821a1694689b45c","observation_id":"dc2e7ed3-6589-478f-8935-61ef15aaacef","resolution":{"observed_at":"2026-08-07T14:02:49.225204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00705","last_updated":"2024-10-30T06:33:02Z","snapshot_observed_at":"2026-08-16T22:22:24.948965Z","submitted_at":"2024-04-23T04:56:48Z","title":"SHED: Shapley-Based Automated Dataset Refinement for Instruction Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00705","snapshot_observed_at":"2026-08-07T14:02:49.299000Z","title":"Shed: Shapley-based automated dataset refinement for instruction fine-tuning.arXiv preprint arXiv:2405.00705, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:49.299000Z"},"links":{"cited_paper":"/paper/2405.00705","citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:42024e7e0889d7d761f4bd48d9d8197b543fdf6b3cc3933552bb0bf68117f3f0","observation_id":"95a37907-86cf-491c-a877-0a13910a9711","resolution":{"observed_at":"2026-08-07T14:02:49.299000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:59.588375Z","title":"Deep reinforcement learning that matters","venue":null,"work_id":"cd0fdd85-6369-428d-9d2d-f5edb5f7c5be","year":2018},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:49.375121Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:93a984cec28285847fe132841422d2ae1df78561cdfa36af08402c1585b012da","observation_id":"20620372-b769-4c87-a658-bac228dd19d7","resolution":{"observed_at":"2026-08-07T14:02:59.662874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:59.452707Z","title":"The n+ implementation details of RLHF with PPO: A case study on TL;DR summariza- tion","venue":null,"work_id":"5059cc6c-00d3-4b7f-a8be-c70c63d932db","year":2024},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:49.501381Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:fae08ba883b69a9236b47c20fa21c04c37446cab0acd9c0bc4e5d59fe08da1ee","observation_id":"bbece51e-00d4-4d24-9192-5dba9d4db59c","resolution":{"observed_at":"2026-08-07T14:02:59.524248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:49.621984Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:49.621984Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:96c28e32b5dca02b5578f9877b0b467da81e3f66edf38997a0ae26112a71641f","observation_id":"b8124faf-1bc8-4262-ace1-63db75208665","resolution":{"observed_at":"2026-08-07T14:02:49.621984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:59.246723Z","title":"Motif: Intrinsic motivation from artificial intelligence feedback","venue":null,"work_id":"f6000c5b-43af-4790-9e44-d738f3e4efb3","year":2024},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:49.724920Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:7fd9cb9870b9fba2c28b0177aadf2df38d600f29ac7d65a376d73f594af0cbfa","observation_id":"3a866c0b-c22a-409f-87a4-802f1b20f79c","resolution":{"observed_at":"2026-08-07T14:02:59.294621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16272","last_updated":"2025-04-22T21:09:33Z","snapshot_observed_at":"2026-08-18T06:47:57.031246Z","submitted_at":"2025-04-22T21:09:33Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","version":1},"cited_work":{"arxiv_id":"2504.16272","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.16272","snapshot_observed_at":"2026-08-07T14:02:54.459404Z","title":"Learning Explainable Dense Reward Shapes via Bayesian Optimization","venue":"cs.LG","work_id":"fb1010d2-62b9-46b0-8bf7-1c7ddb933160","year":2025},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:49.831725Z"},"links":{"cited_paper":"/paper/2504.16272","citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:9e43ab7e5feade19b4fbb2fe93fa2f50c493be126387bf2201447fc816c21560","observation_id":"923e16fe-d3d4-41ca-817b-2a72a70795c5","resolution":{"observed_at":"2026-08-07T14:02:54.542906Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00889","last_updated":"2020-04-22T20:19:19Z","snapshot_observed_at":"2026-08-14T16:21:46.994956Z","submitted_at":"2019-06-03T15:48:38Z","title":"Learning to solve the credit assignment problem","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.00889","snapshot_observed_at":"2026-08-07T14:02:49.925331Z","title":"Learning to solve the credit assignment problem.arXiv preprint arXiv:1906.00889, 2019","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:49.925331Z"},"links":{"cited_paper":"/paper/1906.00889","citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:06355d6ae5be463b68551e199c1a7a0cf0a349b1fa56b8bfe5e54e6d0e09ecfb","observation_id":"5940e98e-e964-4d66-8e02-ca2dd45ca717","resolution":{"observed_at":"2026-08-07T14:02:49.925331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:50.015716Z","title":"Rlaif: Scaling reinforcement learning from human feedback with ai feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:50.015716Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:0a75c02e79b7851f57606bf2a23b55a3c935448db6e9b3183609879538954597","observation_id":"4835cd1c-2cea-4f25-aabb-df4c48127f05","resolution":{"observed_at":"2026-08-07T14:02:50.015716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:50.131641Z","title":"Deep reinforcement learning for dialogue generation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:50.131641Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:7dafcec1b7755faa8c07b52fe56d3356b0d708ffb96e2fa2eeb67b51c5a0c8cc","observation_id":"45ea0ea5-28d8-4e8f-9854-0378078a8d77","resolution":{"observed_at":"2026-08-07T14:02:50.131641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:50.257808Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:50.257808Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:50020453b1e0b49d4cabbae2818f722ed182e87d1f9a9385e07e2414b351dd3a","observation_id":"80478d1d-be3a-4130-9c7c-98cf6fc8935e","resolution":{"observed_at":"2026-08-07T14:02:50.257808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-17T09:42:34.746112Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T14:02:50.353614Z","title":"Let’s verify step by step.arXiv preprint arXiv:2305.20050, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:50.353614Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:e57b409b2928223d3a6209486b71b9eca5412f771ca595ef4809e1d9d1bc3b5e","observation_id":"a1950545-a088-4993-90f3-3b0cfbd807ed","resolution":{"observed_at":"2026-08-07T14:02:50.353614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15395","last_updated":"2024-12-16T08:57:29Z","snapshot_observed_at":"2026-08-16T14:31:55.410425Z","submitted_at":"2023-12-24T03:37:11Z","title":"Prompt Valuation Based on Shapley Values","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15395","snapshot_observed_at":"2026-08-07T14:02:50.454829Z","title":"Prompt valuation based on shapley values.arXiv preprint arXiv:2312.15395, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:50.454829Z"},"links":{"cited_paper":"/paper/2312.15395","citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:f7e3d136f83609d23de06e1268801f82cbe8b2882f29421b29906f77eb40d7b1","observation_id":"74aac5d7-e680-41ab-a8e3-85739a0e9154","resolution":{"observed_at":"2026-08-07T14:02:50.454829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:59.056695Z","title":"A unified approach to interpreting model predic- tions","venue":null,"work_id":"050b79ef-d458-434c-871c-6844e33e1e81","year":2017},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:50.561518Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:12315ed8ebe48697361e43e60bcdfbdff7e14b4feb156c416eca317676306e41","observation_id":"65d8eec0-3b77-4132-b50a-e3b47ed93c33","resolution":{"observed_at":"2026-08-07T14:02:59.154115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:58.928045Z","title":"Maas, Raymond E","venue":null,"work_id":"a2f2f9fe-a6ed-4ac8-959e-067d827aca6d","year":2011},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:50.679815Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:05b47179d3e412dc482e69c3e0ea340a1069f51c8fe8ad79f3f3aea253792983","observation_id":"e3e7845f-221a-4602-b7b2-e0b08359ac53","resolution":{"observed_at":"2026-08-07T14:02:58.974861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:58.757752Z","title":"Marcus, Beatrice Santorini, and Mary Ann Marcinkiewicz","venue":null,"work_id":"fd1793a8-4636-42ab-b37a-6e9655111f34","year":1993},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:50.776810Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:1f8304f0c6fb1ea439d8378cd14632c86e4ede75bf1e34ffa358e6154a788295","observation_id":"0807961e-8681-4744-b617-c924d736c279","resolution":{"observed_at":"2026-08-07T14:02:58.824221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:58.589610Z","title":"Locating and editing factual associations in GPT","venue":null,"work_id":"b2a7a261-d8a5-40b3-84ba-af8072325dc3","year":2022},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:50.878244Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:70ca9ce5b88face110602b51c7882b7c6bf42332d718aacaa1a28c5513ac4c3a","observation_id":"ddaf35c0-ae1c-48bf-aea9-5bcfbc7d9fb6","resolution":{"observed_at":"2026-08-07T14:02:58.724211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01332","last_updated":"2024-11-12T01:06:22Z","snapshot_observed_at":"2026-08-16T14:05:05.032627Z","submitted_at":"2024-03-29T22:49:43Z","title":"Explaining Large Language Models Decisions Using Shapley Values","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01332","snapshot_observed_at":"2026-08-07T14:02:51.005077Z","title":"Explaining large language models decisions using shapley values.arXiv preprint arXiv:2404.01332, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.005077Z"},"links":{"cited_paper":"/paper/2404.01332","citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:ad4cb423189d47ad0578bfebe9dd8b30f80efcb19118dbc5e036303ad9d194ed","observation_id":"dca35289-70b3-431c-8ae7-0b78b4f706d2","resolution":{"observed_at":"2026-08-07T14:02:51.005077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:51.127638Z","title":"Policy invariance under reward transformations: Theory and application to reward shaping","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.127638Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:f6b7adebf50a0c54c2ee6a41da3ad2ee98ce1233135216ca1ed1b217032deb88","observation_id":"a6080ae3-068c-4a6a-8166-4cf33dea9cb2","resolution":{"observed_at":"2026-08-07T14:02:51.127638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:58.373098Z","title":"Ng, Daishi Harada, and Stuart J","venue":null,"work_id":"d7c84c89-5c4f-49e3-bf09-a026aa1d4567","year":1999},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.236634Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:51d935fc7dbe50c54f92395ec5083c931c3cc1a2f09fe816788984ac46d7e563","observation_id":"2fa9f7c1-b7f7-4ab6-8851-ddc99fdf2336","resolution":{"observed_at":"2026-08-07T14:02:58.454841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:58.229601Z","title":"Reward augmented maximum likelihood for neural struc- tured prediction","venue":null,"work_id":"1eefde2f-b7e0-48ce-b445-060763065984","year":2016},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.365584Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:9809318e0ebac33a8b2c59298bdce7faf77b04da6802c9b621dcccf0ad8a5b28","observation_id":"a700ab1d-62d4-4f04-add5-c1a60e894881","resolution":{"observed_at":"2026-08-07T14:02:58.302249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:58.116947Z","title":"Bellemare, Aäron van den Oord, and Rémi Munos","venue":null,"work_id":"ee04f94f-f97e-42d5-ba56-e6c53623bdd5","year":2017},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.437978Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:2773cc324769af467eaf6d85ea8c96bf67624cd0f61d22ade2e2fb1860f1d1a6","observation_id":"90596834-08fb-4250-ad11-3fcc7c2833f6","resolution":{"observed_at":"2026-08-07T14:02:58.165602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:57.968404Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"b4edb299-406c-4c7e-b886-805a6afa1b04","year":2022},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.533140Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:fa001a6f4af0e37e459ee6d76958f678bcf71eb4f2ed0828a1c0bc2ed08261f7","observation_id":"0cfec407-c9bb-4838-934f-68b10a999775","resolution":{"observed_at":"2026-08-07T14:02:58.048153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:57.744667Z","title":"Values of games with a priori unions","venue":null,"work_id":"595c7ec0-afc5-459f-a5e7-b49c4543cdf9","year":1977},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.602173Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:dd10e857c6eebfea54b15282ae3f06ef9f5792c217b2a1ea797e835409352517","observation_id":"954a79f2-696a-4a13-86af-90209ad4f045","resolution":{"observed_at":"2026-08-07T14:02:57.852505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:57.525067Z","title":"Efros, and Trevor Darrell","venue":null,"work_id":"9d988420-c360-47a5-9cff-3e63578f61a7","year":2017},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.665884Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:144fa1d40f7aab30cd510da2509f69d479ff3dfb99e2da3b26a3c43fc0cd7631","observation_id":"a39eb9cf-4926-4acd-9ef3-04925f6e2663","resolution":{"observed_at":"2026-08-07T14:02:57.620498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:51.756802Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.756802Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:edd690b2ede8e6725d5826317d27491c1e8e8d7298701c1ac94bc8680364c9cf","observation_id":"7c57fb9f-e409-4cff-b1f6-ad1f9f889039","resolution":{"observed_at":"2026-08-07T14:02:51.756802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:57.355549Z","title":"Susskind, and Etai Littwin","venue":null,"work_id":"53f52566-a8e8-4de4-9351-771bd45d8cc5","year":2024},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.849366Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:db88c725c94ea9e2a935d9f416af2b935cbfaf1309cd7a7f9560da8c2daa03d5","observation_id":"c904d407-6045-46f1-913d-b07e2d52f4da","resolution":{"observed_at":"2026-08-07T14:02:57.429927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:57.138847Z","title":"Framework of automatic text summarization using rein- forcement learning","venue":null,"work_id":"0f20b939-a3d3-4e79-9f12-9c36263a032f","year":2012},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.955304Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:5126b72308ce40f369a8a9c938d500953edff44f972ce199f65641eaf7690be8","observation_id":"e78090d4-39f5-414a-a6de-c02fe68a4f00","resolution":{"observed_at":"2026-08-07T14:02:57.235460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T14:02:52.068096Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:52.068096Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:5820643e6a6d5298b306cf9b69ac2895d80e63b00f3577363df9895710eb2648","observation_id":"cea8bb73-321f-4be0-81c6-6553b11fd787","resolution":{"observed_at":"2026-08-07T14:02:52.068096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:56.998351Z","title":"Stochastic games","venue":null,"work_id":"d34dd6de-d120-420f-b2c8-8ff7852086d0","year":1953},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:52.167611Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:e3821d08fe2163800aafeb7222caa1aa131c9131e2029ac82a475e0d64436005","observation_id":"e3395b6f-3312-4a39-b806-1bd7a4cbbad8","resolution":{"observed_at":"2026-08-07T14:02:57.081187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:56.832868Z","title":"Learning to summarize with human feed- back","venue":null,"work_id":"3c130ccc-13b9-4c5b-aebc-fdd5d9916e2f","year":2020},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:52.272198Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:43b15b1ff0292bfe190ce3f934e7a7352549245ec65ad9147446d7133422da8e","observation_id":"9a2a059f-6e12-4b66-ae16-ad5840a7275b","resolution":{"observed_at":"2026-08-07T14:02:56.912717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.01731","last_updated":"2025-05-21T01:38:25Z","snapshot_observed_at":"2026-08-18T17:32:11.138384Z","submitted_at":"2025-05-03T07:57:02Z","title":"Efficient Shapley Value-based Non-Uniform Pruning of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.01731","snapshot_observed_at":"2026-08-07T14:02:52.368537Z","title":"Efficient shapley value-based non-uniform pruning of large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:52.368537Z"},"links":{"cited_paper":"/paper/2505.01731","citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:ac7abaa0d1dff6390c0de1a9d531df7f8b6e31035fcec8e19f58586300eed912","observation_id":"a12e3bc6-8b46-4e75-af21-20a83437b598","resolution":{"observed_at":"2026-08-07T14:02:52.368537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:52.459764Z","title":"Temporal credit assignment in reinforcement learning","venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:52.459764Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:16b6f6b67d43e6d9ecb1eb9f383775156307b9bf212d037f4a58501c43c3edea","observation_id":"cd1b4c7f-7d06-4c2c-8bf5-07408b0c8e49","resolution":{"observed_at":"2026-08-07T14:02:52.459764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:56.648035Z","title":"#exploration: A study of count-based exploration for deep reinforcement learning","venue":null,"work_id":"d1bc23d1-c580-4786-99bd-f831905ca96a","year":2017},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:52.542725Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:d4525846365085348a4c30eb79e336690b1ed5369abc5ac95f58d497839ab94e","observation_id":"b607ae6b-4b0e-40e2-85f0-d00d753071b1","resolution":{"observed_at":"2026-08-07T14:02:56.763441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T14:02:52.653221Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:52.653221Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:f3cd0e2aec028109ff8fe900bce3df42e72d6acce72068b910a42948b625979d","observation_id":"0fc0b3de-ddf5-4983-ae3e-385933ce9652","resolution":{"observed_at":"2026-08-07T14:02:52.653221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:52.741740Z","title":"TL;DR: Mining Reddit to learn automatic summarization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:52.741740Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:5bce6540641a783304122e46ac047c81b78ce30eceeaeb5564fa7b48953beb94","observation_id":"ceb5e297-400e-479b-9d3e-a0312e9eb73c","resolution":{"observed_at":"2026-08-07T14:02:52.741740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:52.854545Z","title":"Attention is not not explanation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:52.854545Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:6d34c5c921ffd7e4eb5f917a7ebe05b27b7e482d13d2c078570354e78440e071","observation_id":"54967368-bfc6-4e27-b5d5-f40b6db3c159","resolution":{"observed_at":"2026-08-07T14:02:52.854545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:56.419368Z","title":"Fine-grained human feedback gives better rewards for language model training","venue":null,"work_id":"cc7d9bc2-1b38-4836-85c0-148f430d73f2","year":2023},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:52.905035Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:74601ff2d57d6ae4beee4a5ea55d02565f1f4d2bd757f3cd27ea04452c2bc1c7","observation_id":"0f9c59b6-a227-4413-9fa7-a3c260287e58","resolution":{"observed_at":"2026-08-07T14:02:56.530883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01693","last_updated":"2023-10-30T06:34:35Z","snapshot_observed_at":"2026-08-16T15:27:03.249856Z","submitted_at":"2023-06-02T17:11:37Z","title":"Fine-Grained Human Feedback Gives Better Rewards for Language Model Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01693","snapshot_observed_at":"2026-08-07T14:02:53.016637Z","title":"Fine-grained human feedback gives better rewards for language model training.arXiv preprint arXiv:2306.01693, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:53.016637Z"},"links":{"cited_paper":"/paper/2306.01693","citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:c148b50aea32a7feb62c202e32e9bdf07aa3ed106d46f79d967e405998419740","observation_id":"dcd0fd4d-46e1-47a7-b188-d535a4742fa0","resolution":{"observed_at":"2026-08-07T14:02:53.016637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-acl.88","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"TLCR: Token-level continuous reward for fine-grained reinforcement learning from human feedback","venue":null,"work_id":"c3545723-36f9-4bd1-870c-e70c4c69cd14","year":2024},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:53.127182Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:39cdaa167136eedf9b0b2af2776f42e4042ce8bb3669ffdbfd91ab30ce16464d","observation_id":"5c805033-244a-4388-aa75-5328eaf7dde1","resolution":{"observed_at":"2026-08-07T14:02:54.163998Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:56.235017Z","title":"Towards sample efficient reinforcement learning","venue":null,"work_id":"45de1208-90c5-4f57-8517-d2c4193ac44d","year":2018},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:53.175584Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:a28bfd066e349c360aed3eab25e68aef56d1d4731b7985cae23fefbd2f5a78fe","observation_id":"a4599d54-49a6-4ccc-b274-fa6ff5df1efc","resolution":{"observed_at":"2026-08-07T14:02:56.323483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:56.068780Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":"6e12ec66-bc1c-47cf-88a4-c4bdde3e50e7","year":2023},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:53.295829Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:4c3b2d98f9461475fa0701fe6871e2635a38ce5210df6d727a5aa299b8c997d1","observation_id":"997aa4d8-bef1-47c0-9a3b-f9acda86f54e","resolution":{"observed_at":"2026-08-07T14:02:56.161894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:55.932021Z","title":"Summary A","venue":null,"work_id":"f6825060-ee34-42a6-b053-163cb66747f0","year":2018},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:53.381844Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:032bb663fb7cb60b2db6a422f334b90bb729f009197f9f2f949b921d6da3d668","observation_id":"d94d93f9-bbb6-48ef-8764-c998ec17354c","resolution":{"observed_at":"2026-08-07T14:02:55.994540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:55.726926Z","title":null,"venue":null,"work_id":"a1f32a32-1eeb-41c7-9887-eb38665c875a","year":null},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:53.464113Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:b3a57c9c7bf211ae797e05ad20d401d9092761bfd94133c29a321c3617cbe2b7","observation_id":"68c6fe87-c730-4df0-a51b-1104d04f532c","resolution":{"observed_at":"2026-08-07T14:02:55.831039Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:55.612831Z","title":null,"venue":null,"work_id":"a98224e3-d8e0-4118-88e6-506497f0bb68","year":null},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:53.518839Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:b63e4cb03884aa32fc041605fc1ac06b5cc325b08457673f2d9a4cd36ca1e4b5","observation_id":"f21578aa-b144-4895-94c1-0a92d105c0b9","resolution":{"observed_at":"2026-08-07T14:02:55.662577Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:55.443869Z","title":null,"venue":null,"work_id":"5bf58fdb-ce2f-4002-9c0a-6608812905dd","year":null},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:53.626044Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:1aec291fac281e81998c78023b3ec009aae5fba8344c288e60cebe3cd689deca","observation_id":"4f5eb674-6310-4e38-89f9-e76c90d7e602","resolution":{"observed_at":"2026-08-07T14:02:55.534229Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:55.282903Z","title":null,"venue":null,"work_id":"b450b6b4-df3e-42c8-bc9f-ba0fd1a29503","year":null},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:53.704988Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:1e7d61c53dc3d50832a8801192df22b9df71f4251c58497e339b723c9123774d","observation_id":"8f6aeceb-76b3-4941-9f63-e54b287d6aff","resolution":{"observed_at":"2026-08-07T14:02:55.376042Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:55.060986Z","title":null,"venue":null,"work_id":"2206e363-5273-4a8f-81af-43d2af9681ce","year":null},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:53.786266Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:a5b1e46d46ce07c77a70153c40d739da9b8ea161b0d9745f01c3b9f550b7cfeb","observation_id":"bad3c019-ddff-4c15-9f90-9b7593a92d39","resolution":{"observed_at":"2026-08-07T14:02:55.159381Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:54.867500Z","title":"Regarding Accuracy, Summary A does X well, while Summary B struggles with Y","venue":null,"work_id":"f6f2defa-8725-4cea-9bc9-2415b918acd8","year":null},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:53.893118Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:af53fb8fd1f27e588600ba6282b06680eb62ebd0ee86c52c8f1adead7b1d5e7f","observation_id":"5ac46d6f-82c3-43d0-a1d2-7b304b548185","resolution":{"observed_at":"2026-08-07T14:02:54.935928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:54.682443Z","title":"Overall Decision:","venue":null,"work_id":"b8d06148-2a96-42d8-8fb8-8bda5f9bf090","year":null},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:53.986004Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:191021c2b83a0f8e609ef2057ad422faefdb6fd464fec07bc8b93606acfd76ad","observation_id":"2661a80d-17e4-4de1-820d-106304b625a4","resolution":{"observed_at":"2026-08-07T14:02:54.753819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:48.903735Z","title":"doi: 10.18653/v1/2022.emnlp-main.3","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:48.903735Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:e1ad185024062245d7f47028e98070d348f490c142e37d453fc1540879d24ebc","observation_id":"b0533bca-8468-4552-83e4-a6813b4cbb14","resolution":{"observed_at":"2026-08-07T14:02:48.903735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:47.955869Z","title":"doi: 10.18653/v1/2024.emnlp-main.515","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:47.955869Z"},"links":{"citing_paper":"/paper/2505.20417"},"observation_digest":"sha256:539a22edfd3e203c4ee1f505d90f68a9f6a3893add210c3cc21ebd8071014709","observation_id":"21074c05-c255-462c-a146-800729a97539","resolution":{"observed_at":"2026-08-07T14:02:47.955869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":2,"verified_fuzzy":34},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 7 inbound Pith citation observations for arXiv:2505.20417."}