{"as_of":"2026-08-17T16:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:457ec961c3983cc754958a97cd9e2cbb15b6a24380d739536c6f0e473a5b1526","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:18:06.054981Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T16:26:34.918099Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T01:37:30.522097Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"cited_work":{"arxiv_id":"2506.03234","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03234","snapshot_observed_at":"2026-07-03T01:37:30.522097Z","title":"Badreward: Clean-label poisoning of reward models in text-to-image rlhf","venue":null,"work_id":"4cc720eb-9c8a-43a8-ad3c-4f60fd243201","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-08-15T05:29:27.850072Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":221,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2506.03234","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:9e5f5c4acec570cb76b16f2b98db5f1418a9460bdda81d45e471c3adfbace1df","observation_id":"4b6439e1-8155-4c28-8686-855b5bee67a9","resolution":{"observed_at":"2026-05-10T14:00:28.455819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"cited_work":{"arxiv_id":"2506.03234","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03234","snapshot_observed_at":"2026-07-03T01:37:30.522097Z","title":"Badreward: Clean-label poisoning of reward models in text-to-image rlhf","venue":null,"work_id":"4cc720eb-9c8a-43a8-ad3c-4f60fd243201","year":2025},"citing_paper":{"arxiv_id":"2605.10937","last_updated":"2026-05-11T17:59:25Z","snapshot_observed_at":"2026-08-11T12:59:30.308378Z","submitted_at":"2026-05-11T17:59:25Z","title":"Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T03:33:40.994346Z"},"links":{"cited_paper":"/paper/2506.03234","citing_paper":"/paper/2605.10937"},"observation_digest":"sha256:7a72150a24f7fbda19be3080d3d160d2645617505ddf329af0857370096d62d8","observation_id":"b58c985f-04cf-476f-ab99-e55e1c7a5c69","resolution":{"observed_at":"2026-05-12T07:16:29.437150Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"cited_work":{"arxiv_id":"2506.03234","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03234","snapshot_observed_at":"2026-07-03T01:37:30.522097Z","title":"Badreward: Clean-label poisoning of reward models in text-to-image rlhf","venue":null,"work_id":"4cc720eb-9c8a-43a8-ad3c-4f60fd243201","year":2025},"citing_paper":{"arxiv_id":"2606.09711","last_updated":"2026-06-08T16:32:54Z","snapshot_observed_at":"2026-07-06T23:49:03.237958Z","submitted_at":"2026-06-08T16:32:54Z","title":"Proxy Reward Internalization and Mechanistic Exploitation: A Learned Precursor to Reward Hacking and Its Generalization","version":1},"reference_index":295,"source":"arxiv_source","source_observed_at":"2026-06-27T16:26:34.918099Z"},"links":{"cited_paper":"/paper/2506.03234","citing_paper":"/paper/2606.09711"},"observation_digest":"sha256:5cfcc321192825903f011cb3e20879cd24e39a4a107986d3b38a010ea3f61d3f","observation_id":"2607aec9-0022-4ee2-95b0-b7697c054fc0","resolution":{"observed_at":"2026-07-03T01:37:30.523466Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03234/citation-record","integrity":"/paper/2506.03234/integrity","json":"/paper/2506.03234/citation-record.json","paper":"/paper/2506.03234"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.05530","last_updated":"2024-08-06T14:30:31Z","snapshot_observed_at":"2026-08-16T14:02:43.126602Z","submitted_at":"2024-04-08T13:59:02Z","title":"Best-of-Venom: Attacking RLHF by Injecting Poisoned Preference Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05530","snapshot_observed_at":"2026-08-07T11:18:03.450932Z","title":"Best-of-venom: Attacking rlhf by injecting poisoned preference data.arXiv preprint arXiv:2404.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:03.450932Z"},"links":{"cited_paper":"/paper/2404.05530","citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:1a398e96ea5eb39a002eea5f3ff3ddcd4204d628e35bd6c5ce131e309803faec","observation_id":"c232ca51-e49b-4862-ba9d-ffcc20072146","resolution":{"observed_at":"2026-08-07T11:18:03.450932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1206.6389","last_updated":"2013-03-25T10:16:36Z","snapshot_observed_at":"2026-08-15T00:55:08.947472Z","submitted_at":"2012-06-27T19:59:59Z","title":"Poisoning Attacks against Support Vector Machines","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1206.6389","snapshot_observed_at":"2026-08-07T11:18:03.502246Z","title":"Poisoning attacks against support vector machines.arXiv preprint arXiv:1206.6389, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:03.502246Z"},"links":{"cited_paper":"/paper/1206.6389","citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:d5f6bdfb71987077d4395252b4e7a6f09bc79177b55a2566388d59835b4ad3ba","observation_id":"4c5bc4b2-3cf6-451b-8f0e-fa0f87f8f7ff","resolution":{"observed_at":"2026-08-07T11:18:03.502246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-09T16:20:23.732146Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-08-07T11:18:03.581756Z","title":"Training diffusion models with reinforcement learning.arXiv preprint arXiv:2305.13301, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:03.581756Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:a0b5dc78a7f4f70df2e590a43d76c3e962cd4756f1d0e30b2ac9813bd56cfae1","observation_id":"9a7d5036-1e5b-40ac-86eb-e677ced3f55f","resolution":{"observed_at":"2026-08-07T11:18:03.581756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:03.657237Z","title":"A survey on generative diffusion models.IEEE Transactions on Knowledge and Data Engineering, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:03.657237Z"},"links":{"citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:9f564ed02dc80771e0b33333608407cc6ad864d7bf44396d77bde4853fda7a8b","observation_id":"cc6c3d91-5ef5-4e50-bae9-873226a676fc","resolution":{"observed_at":"2026-08-07T11:18:03.657237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:03.750828Z","title":"Trojdiff: Trojan attacks on diffusion models with diverse targets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:03.750828Z"},"links":{"citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:13cf05cccc12b99d5e4f33e8bf8c4c9cfb144b6dae95a610e4d05b3a4d5878c1","observation_id":"08bfd459-da94-4898-be9a-85e1de397f36","resolution":{"observed_at":"2026-08-07T11:18:03.750828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:08.455112Z","title":"Amplifying membership exposure via data poisoning.Advances in Neural Information Processing Systems, 35:29830– 29844, 2022","venue":null,"work_id":"8406e4ec-363c-44d2-b84c-c713c1457e19","year":2022},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:03.836456Z"},"links":{"citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:b9ce73601d2e170f6720936cbc34d2c9c1db15309459c5bdb260561d4b66d691","observation_id":"161f05ef-a822-4d0d-9935-86d69a731fc9","resolution":{"observed_at":"2026-08-07T11:18:08.561155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:03.929697Z","title":"Villandiffusion: A unified backdoor attack framework for diffusion models.Advances in Neural Information Processing Systems, 36:33912– 33964, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:03.929697Z"},"links":{"citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:16a0da84b904fa68f6dfaa60be49bdb3ad22257d521fbf90cefb8aec18f29c15","observation_id":"e758bf7b-1171-43c7-83a9-775a9b3d7d14","resolution":{"observed_at":"2026-08-07T11:18:03.929697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:03.996111Z","title":"Diffusion models in vision: A survey.IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(9):10850–10869, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:03.996111Z"},"links":{"citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:cfbcf575490e47d0b53c7e0013fcb74d3d1d472d7079b64e5c72529a92c087f5","observation_id":"d73902d0-311e-4dd5-b6c3-8fe604230f35","resolution":{"observed_at":"2026-08-07T11:18:03.996111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:08.268077Z","title":"A survey on data poisoning attacks and defenses","venue":null,"work_id":"242328ba-d24c-422d-8b8f-5d3ddee58ea8","year":2022},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:04.089124Z"},"links":{"citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:8a9e0ca2aa65d0e1cefec6fa196983e1f5baedf00bb4bf53b1c9f8919388b138","observation_id":"37ae54e1-c492-41d2-9d81-98f72add11b5","resolution":{"observed_at":"2026-08-07T11:18:08.342924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:04.152983Z","title":"Dpok: Reinforcement learning for fine-tuning text-to-image diffusion models.Advances in Neural Information Processing Systems, 36:79858–79885, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:04.152983Z"},"links":{"citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:3832d9c96ab8c5f4b8d261138b700c69f6b2548830b7f0e3391d4c22323904e4","observation_id":"154ec68f-8638-40af-9e34-1f2dc9129a4a","resolution":{"observed_at":"2026-08-07T11:18:04.152983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:04.220875Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image generation.Advances in Neural Information Processing Systems, 36:36652–36663, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:04.220875Z"},"links":{"citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:9cace7196e0c20624a529dcd7b6abc8d3fdfbada9f1a9035404728b4563127b4","observation_id":"8d7a39fa-b174-45d3-9f5e-7a4c4ddc7b8f","resolution":{"observed_at":"2026-08-07T11:18:04.220875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12192","last_updated":"2023-02-23T17:34:53Z","snapshot_observed_at":"2026-07-06T14:55:12.100148Z","submitted_at":"2023-02-23T17:34:53Z","title":"Aligning Text-to-Image Models using Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12192","snapshot_observed_at":"2026-08-07T11:18:04.275836Z","title":"Aligning text-to-image models using human feedback.arXiv preprint arXiv:2302.12192, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:04.275836Z"},"links":{"cited_paper":"/paper/2302.12192","citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:26a34e9777ee2b5984bd080762455a686f8b0edcc475d31ef9508dcfc2a5b2ed","observation_id":"b37bad84-ff1b-432d-a2b4-af5336bffd74","resolution":{"observed_at":"2026-08-07T11:18:04.275836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:04.336470Z","title":"Blip: Bootstrapping language- image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:04.336470Z"},"links":{"citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:fe25797a03def497cfedfecbafcef282a58f65519ccab4a4f83bd4fe14f5e2e7","observation_id":"ae670811-d078-4079-a6b9-4f6066a54382","resolution":{"observed_at":"2026-08-07T11:18:04.336470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:08.039336Z","title":"Inform: Mitigating reward hacking in rlhf via information-theoretic reward modeling","venue":null,"work_id":"cde8022e-b81a-48e7-b824-90e3c93aa5a5","year":2024},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:04.397499Z"},"links":{"citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:8e6b83f1bd56974441e365d9b55c6e7bdc5396438d45e32f5b63a3d1f2db1085","observation_id":"48f08532-d743-47ae-a892-36c3f5f6222f","resolution":{"observed_at":"2026-08-07T11:18:08.117549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15213","last_updated":"2025-07-06T01:34:01Z","snapshot_observed_at":"2026-08-16T13:40:42.926904Z","submitted_at":"2024-06-21T14:53:19Z","title":"Backdooring Bias ($B^2$) into Stable Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15213","snapshot_observed_at":"2026-08-07T11:18:04.459824Z","title":"Backdooring bias into text-to-image models.arXiv preprint arXiv:2406.15213, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:04.459824Z"},"links":{"cited_paper":"/paper/2406.15213","citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:5a79b368b9fb71a3d335b6ecdd90401112d69d0ebd92a9be84ec488afeb6597c","observation_id":"e2d3d101-2de6-41d1-ba22-f1a52ee1920b","resolution":{"observed_at":"2026-08-07T11:18:04.459824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:07.906585Z","title":"From trojan horses to castle walls: Unveiling bilateral data poisoning effects in diffusion models.Advances in Neural Information Processing Systems, 37:82265–82295, 2024","venue":null,"work_id":"d58a5fe3-01c8-43d8-a422-696f6a323c5d","year":2024},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:04.508075Z"},"links":{"citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:2b4904e663833399d7b8b2cdee24bb1b5d571ef885451d00e5bd96038e45eeb5","observation_id":"7f949655-be9a-4032-8c9f-09a7e5a7ad61","resolution":{"observed_at":"2026-08-07T11:18:07.974486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:04.576132Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:04.576132Z"},"links":{"citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:cd7bd8da3e40929a30d0cd43f54eafd89ad3edadfa63594a853c379e03c184c1","observation_id":"59a7cbec-dd05-4dad-bc13-825bbfec08d6","resolution":{"observed_at":"2026-08-07T11:18:04.576132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14455","last_updated":"2024-04-29T12:37:59Z","snapshot_observed_at":"2026-08-16T14:40:40.962212Z","submitted_at":"2023-11-24T13:09:34Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14455","snapshot_observed_at":"2026-08-07T11:18:04.647947Z","title":"Universal jailbreak backdoors from poisoned human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:04.647947Z"},"links":{"cited_paper":"/paper/2311.14455","citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:6d243baad92c48051d3e048816f00c3621d95013f12a90de204d8a53dbea7493","observation_id":"b6007439-ac16-4601-bf79-aefa8c707234","resolution":{"observed_at":"2026-08-07T11:18:04.647947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:04.739251Z","title":"Laion- 5b: An open large-scale dataset for training next generation image-text models.Advances in neural information processing systems, 35:25278–25294, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:04.739251Z"},"links":{"citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:80e6277b6622e70e6a3d8b976b5cf55f0a6cb98b862ca014566cc4c07793ff00","observation_id":"50d6e421-ac7a-49fb-9868-0ca8442a5a76","resolution":{"observed_at":"2026-08-07T11:18:04.739251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:07.754718Z","title":"Poison frogs! targeted clean-label poisoning attacks on neural networks.Advances in neural information processing systems, 31, 2018","venue":null,"work_id":"19a5b412-8a86-4e24-a8c7-e2fe52472ffe","year":2018},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:04.821469Z"},"links":{"citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:7c1aae32bc4c90755a8e0a6141908b67ad051e80110557ff09444ecbf900b383","observation_id":"5e05d140-3491-48fb-814f-a6e74ae761a1","resolution":{"observed_at":"2026-08-07T11:18:07.823975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:07.593988Z","title":"Nightshade: Prompt-specific poisoning attacks on text-to-image generative models","venue":null,"work_id":"ebd5d339-a2de-49eb-a8c6-f8ac9575b778","year":2024},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:04.886395Z"},"links":{"citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:3ea9836e586ad23ea952a0ddb6457ff13dbc54c73152f84c8fde4340a2045b53","observation_id":"54f7eae3-a740-4c7a-ad9f-5aac9f7f5c47","resolution":{"observed_at":"2026-08-07T11:18:07.666359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:04.937273Z","title":"Defining and characterizing reward gaming.Advances in Neural Information Processing Systems, 35:9460– 9471, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:04.937273Z"},"links":{"citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:20a191a06b4c1c41b2efd193a4d07319863be5c9f3ec0eb8c6cb35999171b087","observation_id":"9380d697-33e0-47d7-8aa8-f39f48fe80e4","resolution":{"observed_at":"2026-08-07T11:18:04.937273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:07.358653Z","title":"Attacks and defenses for generative diffusion models: A comprehensive survey.ACM Computing Surveys, 57(8):1–44, 2025","venue":null,"work_id":"ede99813-7e0f-4601-9c36-7f679f1fc0f5","year":2025},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:04.989332Z"},"links":{"citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:c3f68ac731a6a3f2165bca3fedb8ebec711495d1e669702d443583e187320195","observation_id":"ff8d6a03-ecc2-4516-9809-9da4766a8a65","resolution":{"observed_at":"2026-08-07T11:18:07.493436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:07.198212Z","title":"Rlhfpoi- son: Reward poisoning attack for reinforcement learning with human feedback in large language models","venue":null,"work_id":"99d05919-ad96-40c1-890d-f2cd0faeca10","year":2024},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:05.061206Z"},"links":{"citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:4942c10dc61edad1a33907b27489933b4d461f4609e9d684e90367e8c3b30795","observation_id":"c35545e0-c05a-4570-9d41-3a9605c58095","resolution":{"observed_at":"2026-08-07T11:18:07.285820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01920","last_updated":"2024-10-08T20:32:15Z","snapshot_observed_at":"2026-08-16T14:21:59.310920Z","submitted_at":"2024-02-02T21:45:24Z","title":"Preference Poisoning Attacks on Reward Model Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01920","snapshot_observed_at":"2026-08-07T11:18:05.136617Z","title":"Preference poisoning attacks on reward model learning.arXiv preprint arXiv:2402.01920, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:05.136617Z"},"links":{"cited_paper":"/paper/2402.01920","citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:b06c7660e55d11a4247538925af8e7c79b0b24ce80411c2870f97a6d7a7f0a03","observation_id":"d7e337ca-da47-4492-90f3-2a6be172ac8c","resolution":{"observed_at":"2026-08-07T11:18:05.136617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-08-14T02:46:25.655503Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-07T11:18:05.209176Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis.arXiv preprint arXiv:2306.09341, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:05.209176Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:5f8276c105a1f4e307ea164482673c853b76147307a3120c80c69cbba58e5481","observation_id":"6c07524e-4b2d-4435-b510-47ce1c7e16e8","resolution":{"observed_at":"2026-08-07T11:18:05.209176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:05.279581Z","title":"Human preference score: Better aligning text-to-image models with human preference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:05.279581Z"},"links":{"citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:ae8c122ee3047b066e345f2bf68b6ce39f32df55caaa8acbb322b76fb6c597a3","observation_id":"5955355f-aeb3-4f18-a634-ce49693845f4","resolution":{"observed_at":"2026-08-07T11:18:05.279581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:07.013663Z","title":"Adversarial label flips attack on support vector machines","venue":null,"work_id":"5c2cc9a1-57a6-449e-84d0-faeba3818d3b","year":2012},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:05.358874Z"},"links":{"citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:27650ecc18ced88071c35213e6695902706922eccd1bec277a055f8759ae8219","observation_id":"180fd271-a4cc-4700-9b6f-c017fbcedf9d","resolution":{"observed_at":"2026-08-07T11:18:07.088382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:05.433869Z","title":"Imagereward: Learning and evaluating human preferences for text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:05.433869Z"},"links":{"citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:3f5a4b550138c65c0728b70b52c15676c3fccb2bf3746eba5a266b4a8c6a0870","observation_id":"fd29907a-9f14-49c8-b5f2-e187b32ce0d1","resolution":{"observed_at":"2026-08-07T11:18:05.433869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06659","last_updated":"2024-10-14T16:17:34Z","snapshot_observed_at":"2026-08-16T14:21:17.676802Z","submitted_at":"2024-02-05T18:55:53Z","title":"Shadowcast: Stealthy Data Poisoning Attacks Against Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06659","snapshot_observed_at":"2026-08-07T11:18:05.514154Z","title":"Shadowcast: Stealthy data poisoning attacks against vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:05.514154Z"},"links":{"cited_paper":"/paper/2402.06659","citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:87b6b11b47a595eda2c7649b9d87c93945438d8ef1b72248e8b46b6c974ec5b1","observation_id":"859bd800-3a36-4ae6-9149-195f24f1cdce","resolution":{"observed_at":"2026-08-07T11:18:05.514154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:06.839876Z","title":"Using human feedback to fine-tune diffusion models without any reward model","venue":null,"work_id":"b64ce7fe-f548-4509-a8e1-4d6dbebd5d6a","year":2024},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:05.550741Z"},"links":{"citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:4963fbf4541ceb5f3748712af6bcdba951ea69d758fc432c4679678b1d951a36","observation_id":"3e6ebbea-9cba-46fe-a5b7-8c55c5a571cc","resolution":{"observed_at":"2026-08-07T11:18:06.916979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:05.607651Z","title":"Diffusion models: A comprehensive survey of methods and applications.ACM Computing Surveys, 56(4):1–39, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:05.607651Z"},"links":{"citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:4e517da0ba351f4ddcd2f63364b628bb6003f8cf455bb4f7b5dc45c146248591","observation_id":"65970768-5df4-4d28-8b38-2231aaf7b64e","resolution":{"observed_at":"2026-08-07T11:18:05.607651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:06.598074Z","title":"Poisonprompt: Backdoor attack on prompt-based large language models","venue":null,"work_id":"15735b18-557a-41e0-b276-889d78886801","year":2024},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:05.679279Z"},"links":{"citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:77dbc8a6a99dab959d513ad743ed8fabf1b681957d6ec7f1aac146d87bc13e70","observation_id":"3442542c-30c4-4352-af91-c631d8821e31","resolution":{"observed_at":"2026-08-07T11:18:06.732475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:05.729802Z","title":"Text- to-image diffusion models can be easily backdoored through multimodal data poisoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:05.729802Z"},"links":{"citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:bb8b5d2fd095d09be04d14a148329175e7ea36678a31c710fabf19b983e08abd","observation_id":"0341263c-6b8a-4661-8ce4-95d8a6a8b82d","resolution":{"observed_at":"2026-08-07T11:18:05.729802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07909","last_updated":"2024-11-08T06:19:33Z","snapshot_observed_at":"2026-08-16T15:48:19.904424Z","submitted_at":"2023-03-14T13:49:54Z","title":"Text-to-image Diffusion Models in Generative AI: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07909","snapshot_observed_at":"2026-08-07T11:18:05.800563Z","title":"Text-to-image diffusion models in generative ai: A survey.arXiv preprint arXiv:2303.07909, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:05.800563Z"},"links":{"cited_paper":"/paper/2303.07909","citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:52cf49613c6607a008739dfda4b47c65cd038e45fd15e350fac7379e4b7620e1","observation_id":"e7e926ed-4c2b-437d-bc93-608708a72727","resolution":{"observed_at":"2026-08-07T11:18:05.800563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:05.875543Z","title":"Aligning few-step diffusion models with dense reward difference learning.arXiv preprint arXiv:2411.11727, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:05.875543Z"},"links":{"citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:ba1c8cb8c89aec1f72e150d86d1be6bb0756c670b7e9bbcc40de8f59364d8ebe","observation_id":"2b07a20c-d990-48b9-a212-dd7b6110fd25","resolution":{"observed_at":"2026-08-07T11:18:05.875543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:06.349631Z","title":"Shielding collaborative learning: Mitigating poisoning attacks through client-side detection.IEEE Transactions on Dependable and Secure Computing, 18(5):2029–2041, 2020","venue":null,"work_id":"206a0481-952b-41ed-ae01-90d7370133c6","year":2020},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:05.936387Z"},"links":{"citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:970eec10a6dd10bdd071ccf17022442c298752a561aa3c014c4f8af50b33eb65","observation_id":"e09bfbe4-338b-43b7-8659-9d26de7da513","resolution":{"observed_at":"2026-08-07T11:18:06.433447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01223","last_updated":"2024-02-23T14:42:57Z","snapshot_observed_at":"2026-08-16T14:46:32.788105Z","submitted_at":"2023-11-02T13:23:39Z","title":"Diffusion Models for Reinforcement Learning: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01223","snapshot_observed_at":"2026-08-07T11:18:05.968907Z","title":"accident-blood","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:05.968907Z"},"links":{"cited_paper":"/paper/2311.01223","citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:4ffe2fa4955eb97c5f1be25d73567de0c7c8ede009c44cdc390f87554316a245","observation_id":"e9268e5d-894a-41da-860e-3e09c4e33196","resolution":{"observed_at":"2026-08-07T11:18:05.968907Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:18:06.245620Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"bb7459b2-9cdf-4669-90f0-ab9f0048aaff","year":2025},"citing_paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:06.054981Z"},"links":{"citing_paper":"/paper/2506.03234"},"observation_digest":"sha256:1f89e7c0ee195a72e8cc7f2532216d8b19de2307c3525c02a3d7dc0803ecddb7","observation_id":"c89c4aad-343c-4484-8241-cfbb1765f46e","resolution":{"observed_at":"2026-08-07T11:18:06.292128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03234","last_updated":"2025-06-03T16:01:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T11:07:52.462747Z","submitted_at":"2025-06-03T16:01:04Z","title":"BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 3 inbound Pith citation observations for arXiv:2506.03234."}