{"as_of":"2026-08-16T18:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b36e212922765075102d202577da9d2f6b74ff0994fa671bd1abc5e48ecb2978","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:44:39.682811Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.19567/citation-record","integrity":"/paper/2508.19567/integrity","json":"/paper/2508.19567/citation-record.json","paper":"/paper/2508.19567"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.17813","last_updated":"2025-07-24T15:10:45Z","snapshot_observed_at":"2026-08-16T13:39:57.011778Z","submitted_at":"2024-06-24T23:41:46Z","title":"Unsupervised Concept Drift Detection from Deep Learning Representations in Real-time","version":2},"cited_work":{"arxiv_id":"2406.17813","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.17813","snapshot_observed_at":"2026-08-05T15:44:40.781356Z","title":"Unsupervised Concept Drift Detection from Deep Learning Representations in Real-time","venue":"cs.LG","work_id":"843f36fe-a48f-457f-9406-5ea0f3c06739","year":2024},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-15T03:35:10.348243Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:38.297770Z"},"links":{"cited_paper":"/paper/2406.17813","citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:7564d2da4946377305770a73df665d54c6eee79c3930ba39f57e86592fb5fc11","observation_id":"1cf30fcf-e54a-45fa-9ab9-c9fea9ad904a","resolution":{"observed_at":"2026-08-05T15:44:40.886960Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11309","last_updated":"2023-06-15T00:12:54Z","snapshot_observed_at":"2026-08-16T15:46:47.185758Z","submitted_at":"2023-03-20T17:47:31Z","title":"Bubbling of K\\\"ahler-Einstein metrics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11309","snapshot_observed_at":"2026-08-05T15:44:38.462427Z","title":"A., Benajiba, Y., Ballesteros, M.: Dynamic Benchmarking of Masked Language Models on Temporal Concept Drift with Multiple Views","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-15T03:35:10.348243Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:38.462427Z"},"links":{"cited_paper":"/paper/2303.11309","citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:9126b18f4ae431a61104410041d331de5bb6a08930181f981e2ff3434bf6c1d2","observation_id":"0054fdc0-6a7b-4d2a-954e-9f7e225cbcba","resolution":{"observed_at":"2026-08-05T15:44:38.462427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09160","last_updated":"2024-12-12T10:46:14Z","snapshot_observed_at":"2026-08-14T14:31:36.008835Z","submitted_at":"2024-12-12T10:46:14Z","title":"Pinpoint Counterfactuals: Reducing social bias in foundation models via localized counterfactual generation","version":1},"cited_work":{"arxiv_id":"2412.09160","doi":"10.48550/arxiv.2412.09160","metadata_source":"pith","pith_arxiv_id":"2412.09160","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Pinpoint Counterfactuals: Reducing social bias in foundation models via localized counterfactual generation","venue":"cs.CV","work_id":"2f3fb410-1c96-4e02-a39a-933a3acd6ddd","year":2024},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-15T03:35:10.348243Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:38.520437Z"},"links":{"cited_paper":"/paper/2412.09160","citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:eadd4499141a2580c0670d6bae0f1cd7957f0e0f65206448b3477a59c65fca11","observation_id":"6687d88d-2e56-49f3-ac17-78c763673605","resolution":{"observed_at":"2026-08-05T15:44:40.151591Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16455","last_updated":"2025-08-25T01:01:38Z","snapshot_observed_at":"2026-08-16T13:49:22.343595Z","submitted_at":"2024-05-26T07:00:05Z","title":"On the Algorithmic Bias of Aligning Large Language Models with RLHF: Preference Collapse and Matching Regularization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16455","snapshot_observed_at":"2026-08-05T15:44:38.622610Z","title":"J.: On the Algorithmic Bias of Aligning Large Language Models with RLHF: Preference Collapse and Matching Regularization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-15T03:35:10.348243Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:38.622610Z"},"links":{"cited_paper":"/paper/2405.16455","citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:03035bfddd721b521cff02bb3ed38a68ec235b6566a5439e4a9e610c7010aefc","observation_id":"7c1c29ba-f599-4abb-8e1f-7192e8ac808e","resolution":{"observed_at":"2026-08-05T15:44:38.622610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:44:41.231819Z","title":"ACL Long Paper (2025)","venue":null,"work_id":"d8def3af-a9e2-4d73-a6f1-44d48e71dc72","year":2025},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-15T03:35:10.348243Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:38.744210Z"},"links":{"citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:2e3e14fd77bd835d1bc57edc8fdc2dbfa8b22cf4e0cca9bd29d4544d04df8b69","observation_id":"93716715-9978-42be-a103-bf34678de6da","resolution":{"observed_at":"2026-08-05T15:44:41.374021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14758","last_updated":"2024-11-07T15:40:25Z","snapshot_observed_at":"2026-08-16T13:50:06.573093Z","submitted_at":"2024-05-23T16:29:29Z","title":"Axioms for AI Alignment from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14758","snapshot_observed_at":"2026-08-05T15:44:38.879132Z","title":"arXiv preprint (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-15T03:35:10.348243Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:38.879132Z"},"links":{"cited_paper":"/paper/2405.14758","citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:4bb5dadead9a369764ac7b48f904df8d6fb59d735365ae7bcebeef544931a56b","observation_id":"7c5af0fe-90f3-4854-93b8-aefbc3283826","resolution":{"observed_at":"2026-08-05T15:44:38.879132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-16T14:07:56.582345Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T15:44:38.975171Z","title":"arXiv preprint (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-15T03:35:10.348243Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:38.975171Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:87ad70e3ecca3411b1fa17a4aa49e74527955b95eb4ba414524448ffc60523ae","observation_id":"4b4df1d4-e9d8-435f-ae1b-2cbf8d1d07bf","resolution":{"observed_at":"2026-08-05T15:44:38.975171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12773","last_updated":"2023-10-19T14:22:03Z","snapshot_observed_at":"2026-08-14T19:10:00.850271Z","submitted_at":"2023-10-19T14:22:03Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12773","snapshot_observed_at":"2026-08-05T15:44:39.099633Z","title":"arXiv preprint (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-15T03:35:10.348243Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:39.099633Z"},"links":{"cited_paper":"/paper/2310.12773","citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:9d0cc9507cdb6694bc2b4a4ebffb8fb0bc039a9d81cf790c573fb4b72d642df2","observation_id":"923a96db-b7f5-4e3f-8c12-29fc44fb86ba","resolution":{"observed_at":"2026-08-05T15:44:39.099633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcai.2024/250","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"IJCAI (2024)","venue":null,"work_id":"e95de6e2-a3e2-4073-967b-02186e095128","year":2024},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-15T03:35:10.348243Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:39.196330Z"},"links":{"citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:419b9ae47a09c77705f4cda7b1c44cd8dddb7865575caf5b0af96cec63083641","observation_id":"79ff5b0a-2487-4a5b-988f-5aaa386772ad","resolution":{"observed_at":"2026-08-05T15:44:39.890905Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9764.36931","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:44:40.563993Z","title":"F AccT (2024)","venue":null,"work_id":"455e0db4-9bcb-4f84-b70e-48798dffa42c","year":2024},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-15T03:35:10.348243Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:39.300014Z"},"links":{"citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:3aa66b9c6176ac4c5235b058802a114e2be1448e2216318bafa4a79df62aa226","observation_id":"a68d5bed-fb1d-4a56-9f91-be3f92577fb8","resolution":{"observed_at":"2026-08-05T15:44:40.665521Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:44:39.360105Z","title":"NeurIPS Workshops (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-15T03:35:10.348243Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:39.360105Z"},"links":{"citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:85983cf71a82c3dc52206cba7d231654debbf23bc2ac4fbafaea65557ef1dde2","observation_id":"a4af2564-5cdd-4f01-a626-dd9f741fb5ef","resolution":{"observed_at":"2026-08-05T15:44:39.360105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07085","last_updated":"2025-08-09T19:39:33Z","snapshot_observed_at":"2026-08-15T03:34:26.952779Z","submitted_at":"2025-08-09T19:39:33Z","title":"Improving Real-Time Concept Drift Detection using a Hybrid Transformer-Autoencoder Framework","version":1},"cited_work":{"arxiv_id":"2508.07085","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.07085","snapshot_observed_at":"2026-08-05T15:44:40.289426Z","title":"Improving Real-Time Concept Drift Detection using a Hybrid Transformer-Autoencoder Framework","venue":"cs.LG","work_id":"efe1d55f-d52d-4707-9527-1b94c519ce05","year":2025},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-15T03:35:10.348243Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:39.466931Z"},"links":{"cited_paper":"/paper/2508.07085","citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:ca68fad6ab6122a1bfe1ac82a695185129680880e7852e5035fcbfb18a5415e5","observation_id":"3d59fb5e-1a28-4c03-9309-037afe1233a1","resolution":{"observed_at":"2026-08-05T15:44:40.354785Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:44:41.013562Z","title":"arXiv preprint (2023)","venue":null,"work_id":"ff904298-d990-4d6c-9c6e-48c28448900e","year":2023},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-15T03:35:10.348243Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:39.567689Z"},"links":{"citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:e060a78c012eef5c5135280cd64b853d382e1ccac8ce71feee28ffa62ba428b5","observation_id":"f32b68ef-3f2b-4d9b-89dd-26e0656748e7","resolution":{"observed_at":"2026-08-05T15:44:41.127320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12345","last_updated":"2025-01-21T18:23:42Z","snapshot_observed_at":"2026-08-15T02:13:24.349114Z","submitted_at":"2025-01-21T18:23:42Z","title":"The doubly librating Plutinos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12345","snapshot_observed_at":"2026-08-05T15:44:39.682811Z","title":"arXiv preprint (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-15T03:35:10.348243Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:39.682811Z"},"links":{"cited_paper":"/paper/2501.12345","citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:17c7608bb70a5ded37c2730d8c26584fdcb87010a428be63bbec86dc876529f9","observation_id":"e1b5eae3-ff19-4adf-a37f-730502636d27","resolution":{"observed_at":"2026-08-05T15:44:39.682811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T03:35:10.348243Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":7,"verified_exact":2,"verified_fuzzy":2},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2508.19567."}