{"as_of":"2026-08-19T09:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a88e1ed5ebfb8bfcf86851ba91836956f774c6a9b72ed5b7ae3466e17a27f5c8","coverage":[{"denominator":10,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T22:48:13.389900Z","state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2511.10687/citation-record","integrity":"/paper/2511.10687/integrity","json":"/paper/2511.10687/citation-record.json","paper":"/paper/2511.10687"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:48:13.182497Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.10687","last_updated":"2026-07-01T23:47:17Z","snapshot_observed_at":"2026-08-16T01:47:59.699882Z","submitted_at":"2025-11-11T22:21:08Z","title":"Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T22:48:13.182497Z"},"links":{"citing_paper":"/paper/2511.10687"},"observation_digest":"sha256:2fe633835a6ec4ea9f58d4fb62c0db08071392f4dd3d8b30b6692c6081c04a5a","observation_id":"ebfb17e4-39e8-481a-8c56-62b9d8c4efc8","resolution":{"observed_at":"2026-08-03T22:48:13.182497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:48:13.286579Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.10687","last_updated":"2026-07-01T23:47:17Z","snapshot_observed_at":"2026-08-16T01:47:59.699882Z","submitted_at":"2025-11-11T22:21:08Z","title":"Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T22:48:13.286579Z"},"links":{"citing_paper":"/paper/2511.10687"},"observation_digest":"sha256:28cb5afa03f8112da3e20583557f8bb09cb4e98950413ce4f2f0b252bd6d66a1","observation_id":"7779f0d2-8a8a-461e-8760-1f5f4956eec8","resolution":{"observed_at":"2026-08-03T22:48:13.286579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:48:13.389900Z","title":"A.2.1 PLUGGING THE SIGNALS INTO POST-TRAINING Success route (RL-style).Use {ri,t} as per-message rewards for each agent policy πi","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2511.10687","last_updated":"2026-07-01T23:47:17Z","snapshot_observed_at":"2026-08-16T01:47:59.699882Z","submitted_at":"2025-11-11T22:21:08Z","title":"Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T22:48:13.389900Z"},"links":{"citing_paper":"/paper/2511.10687"},"observation_digest":"sha256:6db9f12629cb919bec4f6249a57b2f931296638894f587279a5be68667e8fd83","observation_id":"6d528103-0915-49a8-bde4-887ad2280f9a","resolution":{"observed_at":"2026-08-03T22:48:13.389900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:48:12.972733Z","title":"Hanhan Zhou, Tian Lan, and Vaneet Aggarwal","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.10687","last_updated":"2026-07-01T23:47:17Z","snapshot_observed_at":"2026-08-16T01:47:59.699882Z","submitted_at":"2025-11-11T22:21:08Z","title":"Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T22:48:12.972733Z"},"links":{"citing_paper":"/paper/2511.10687"},"observation_digest":"sha256:6091c430f86c50f441c0aecbb7fa84c12ca4ccb61c7fa9438ba75d21b851d052","observation_id":"d8b051f7-8a88-452a-9f97-57fe3d7156d7","resolution":{"observed_at":"2026-08-03T22:48:12.972733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:48:13.075374Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.10687","last_updated":"2026-07-01T23:47:17Z","snapshot_observed_at":"2026-08-16T01:47:59.699882Z","submitted_at":"2025-11-11T22:21:08Z","title":"Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T22:48:13.075374Z"},"links":{"citing_paper":"/paper/2511.10687"},"observation_digest":"sha256:efc9cccf0b0bc37adff2859a99a7dfcf9acc90cd932d2158959cbaba6d73ec12","observation_id":"4dbc5025-f6a2-4325-b958-526dbb994880","resolution":{"observed_at":"2026-08-03T22:48:13.075374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1306.4265","last_updated":"2014-02-12T22:51:33Z","snapshot_observed_at":"2026-08-15T15:25:03.089380Z","submitted_at":"2013-06-18T16:51:53Z","title":"Bounding the Estimation Error of Sampling-based Shapley Value Approximation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.4265","snapshot_observed_at":"2026-08-03T22:48:12.451470Z","title":"Jacob Menick, Victoria Krakovna, Lawrence Chan, Michael Laskin, et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.10687","last_updated":"2026-07-01T23:47:17Z","snapshot_observed_at":"2026-08-16T01:47:59.699882Z","submitted_at":"2025-11-11T22:21:08Z","title":"Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents","version":3},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-03T22:48:12.451470Z"},"links":{"cited_paper":"/paper/1306.4265","citing_paper":"/paper/2511.10687"},"observation_digest":"sha256:cb1e554aa887f646b0c93682e8bc497ee50d6990e8c379f43fc9de7a2414bf59","observation_id":"9386696a-3c67-4049-beee-c373ae487399","resolution":{"observed_at":"2026-08-03T22:48:12.451470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14465","last_updated":"2022-05-20T13:52:54Z","snapshot_observed_at":"2026-08-16T17:11:25.867747Z","submitted_at":"2022-03-28T03:12:15Z","title":"STaR: Bootstrapping Reasoning With Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14465","snapshot_observed_at":"2026-08-03T22:48:12.820859Z","title":"Eric Zelikman, Yuhuai Wu, Noah D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.10687","last_updated":"2026-07-01T23:47:17Z","snapshot_observed_at":"2026-08-16T01:47:59.699882Z","submitted_at":"2025-11-11T22:21:08Z","title":"Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T22:48:12.820859Z"},"links":{"cited_paper":"/paper/2203.14465","citing_paper":"/paper/2511.10687"},"observation_digest":"sha256:564aef1bb83ac5fed8cad23d1e5160d88ff698674a9b04a8ac5ae27b5cc9ec09","observation_id":"fbdf2d18-0fcd-47dd-a69d-c5e64652322b","resolution":{"observed_at":"2026-08-03T22:48:12.820859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-03T22:48:12.563763Z","title":"Joshua Owotogbe","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.10687","last_updated":"2026-07-01T23:47:17Z","snapshot_observed_at":"2026-08-16T01:47:59.699882Z","submitted_at":"2025-11-11T22:21:08Z","title":"Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T22:48:12.563763Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2511.10687"},"observation_digest":"sha256:67d3ddbf7905334a0269aba2d1a8038a23ce9d245625849abbbd13bd4c07c223","observation_id":"8bf93735-835e-413d-9cbc-2c78b0cbc75d","resolution":{"observed_at":"2026-08-03T22:48:12.563763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-03T22:48:12.670792Z","title":"Tabish Rashid, Mikayel Samvelyan, Christian De Witt, Gregory Farquhar, Jakob Foerster, and Shimon Whiteson","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.10687","last_updated":"2026-07-01T23:47:17Z","snapshot_observed_at":"2026-08-16T01:47:59.699882Z","submitted_at":"2025-11-11T22:21:08Z","title":"Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T22:48:12.670792Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2511.10687"},"observation_digest":"sha256:a41d8621fafb3d741686b89393627fb452545917b79fc44471e7151027391c1b","observation_id":"6536a929-c228-4cbf-8654-d7abe1360432","resolution":{"observed_at":"2026-08-03T22:48:12.670792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-16T14:52:03.015380Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20417","snapshot_observed_at":"2026-08-03T22:48:12.321881Z","title":"Javier Castro, Daniel G´omez, and Juan Tejada","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2511.10687","last_updated":"2026-07-01T23:47:17Z","snapshot_observed_at":"2026-08-16T01:47:59.699882Z","submitted_at":"2025-11-11T22:21:08Z","title":"Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T22:48:12.321881Z"},"links":{"cited_paper":"/paper/2505.20417","citing_paper":"/paper/2511.10687"},"observation_digest":"sha256:9e6233b22a01eed1e6877b2c5e54898f5432d7415591ac59dd2911fe776ffa93","observation_id":"6fa6716e-04e7-41c2-a61f-c2dcbd4576e4","resolution":{"observed_at":"2026-08-03T22:48:12.321881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.10687","last_updated":"2026-07-01T23:47:17Z","latest_version":3,"primary_category":"cs.MA","snapshot_observed_at":"2026-08-16T01:47:59.699882Z","submitted_at":"2025-11-11T22:21:08Z","title":"Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents"},"reference_resolution":{"displayed":10,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":10},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 10 of 10 outbound references and 0 inbound Pith citation observations for arXiv:2511.10687."}