{"as_of":"2026-08-08T22:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:09b30603a6da677d121688ccaf0e772626d0cc061fde12b4e9651446421d73bb","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T21:49:10.161724Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T10:32:57.295159Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T09:07:47.890063Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.19101","last_updated":"2026-06-03T08:52:56Z","snapshot_observed_at":"2026-08-06T06:49:38.112037Z","submitted_at":"2026-02-22T09:11:26Z","title":"Value Entanglement: Conflation Between Different Kinds of Good In (Some) Large Language Models","version":2},"cited_work":{"arxiv_id":"2602.19101","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.19101","snapshot_observed_at":"2026-07-03T09:07:47.890063Z","title":"Value Entanglement: Conflation Between Different Kinds of Good In (Some) Large Language Models","venue":"cs.CL","work_id":"7d929860-de27-4188-9737-9d775c29f0d0","year":2026},"citing_paper":{"arxiv_id":"2606.12360","last_updated":"2026-06-10T17:31:16Z","snapshot_observed_at":"2026-07-06T23:51:17.719874Z","submitted_at":"2026-06-10T17:31:16Z","title":"Anatomy of Post-Training: Using Interpretability to Characterize Data and Shape the Learning Signal","version":1},"reference_index":292,"source":"arxiv_source","source_observed_at":"2026-06-27T10:32:57.295159Z"},"links":{"cited_paper":"/paper/2602.19101","citing_paper":"/paper/2606.12360"},"observation_digest":"sha256:fc0067a2b58f92f057c94218f6bf70992fdd66016c0ed0eceafb7878bd1a1bc8","observation_id":"b6ef70d9-560b-4770-94b7-d55c7f28f91a","resolution":{"observed_at":"2026-07-03T09:07:47.891206Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.19101/citation-record","integrity":"/paper/2602.19101/integrity","json":"/paper/2602.19101/citation-record.json","paper":"/paper/2602.19101"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.16244","last_updated":"2024-04-28T18:28:33Z","snapshot_observed_at":"2026-08-06T06:48:41.511859Z","submitted_at":"2024-04-24T23:18:46Z","title":"The Ethics of Advanced AI Assistants","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16244","snapshot_observed_at":"2026-08-02T21:49:09.436079Z","title":"Gemma Team, Riviere, M., Pathak, S., Sessa, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19101","last_updated":"2026-06-03T08:52:56Z","snapshot_observed_at":"2026-08-06T06:49:38.112037Z","submitted_at":"2026-02-22T09:11:26Z","title":"Value Entanglement: Conflation Between Different Kinds of Good In (Some) Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T21:49:09.436079Z"},"links":{"cited_paper":"/paper/2404.16244","citing_paper":"/paper/2602.19101"},"observation_digest":"sha256:28e52781f5901cdc57229f5b2065110e02fbc7eb1d5abeb79b3bdc22328f06d8","observation_id":"a02c9c72-c23a-4358-9bcb-d17f97eaefa6","resolution":{"observed_at":"2026-08-02T21:49:09.436079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13916","last_updated":"2022-06-16T21:12:42Z","snapshot_observed_at":"2026-07-06T11:52:19.105210Z","submitted_at":"2021-09-28T17:59:36Z","title":"Unsolved Problems in ML Safety","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13916","snapshot_observed_at":"2026-08-02T21:49:09.522544Z","title":"Leshinskaya, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19101","last_updated":"2026-06-03T08:52:56Z","snapshot_observed_at":"2026-08-06T06:49:38.112037Z","submitted_at":"2026-02-22T09:11:26Z","title":"Value Entanglement: Conflation Between Different Kinds of Good In (Some) Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T21:49:09.522544Z"},"links":{"cited_paper":"/paper/2109.13916","citing_paper":"/paper/2602.19101"},"observation_digest":"sha256:a8309f9112a0c278bb192c380dc224d3cad9e9263d05ad55d2e3d3d5bca43290","observation_id":"476eb455-e5a0-4b8e-8197-863197103191","resolution":{"observed_at":"2026-08-02T21:49:09.522544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08640","last_updated":"2025-02-19T06:48:30Z","snapshot_observed_at":"2026-08-07T23:55:35.740041Z","submitted_at":"2025-02-12T18:55:43Z","title":"Utility Engineering: Analyzing and Controlling Emergent Value Systems in AIs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08640","snapshot_observed_at":"2026-08-02T21:49:09.679130Z","title":"URLarXiv:2502.08640","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19101","last_updated":"2026-06-03T08:52:56Z","snapshot_observed_at":"2026-08-06T06:49:38.112037Z","submitted_at":"2026-02-22T09:11:26Z","title":"Value Entanglement: Conflation Between Different Kinds of Good In (Some) Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T21:49:09.679130Z"},"links":{"cited_paper":"/paper/2502.08640","citing_paper":"/paper/2602.19101"},"observation_digest":"sha256:a05caa3afdc8f37f8e6469623076da49b99e0d7d6c273ea5dabc4d5353a20fc4","observation_id":"6b90d727-52ab-4803-b6fb-de0f44b4b028","resolution":{"observed_at":"2026-08-02T21:49:09.679130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06681","last_updated":"2024-07-05T15:30:45Z","snapshot_observed_at":"2026-08-07T14:28:06.805424Z","submitted_at":"2023-12-09T04:40:46Z","title":"Steering Llama 2 via Contrastive Activation Addition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06681","snapshot_observed_at":"2026-08-02T21:49:09.785134Z","title":"org/abs/2312.06681","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19101","last_updated":"2026-06-03T08:52:56Z","snapshot_observed_at":"2026-08-06T06:49:38.112037Z","submitted_at":"2026-02-22T09:11:26Z","title":"Value Entanglement: Conflation Between Different Kinds of Good In (Some) Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T21:49:09.785134Z"},"links":{"cited_paper":"/paper/2312.06681","citing_paper":"/paper/2602.19101"},"observation_digest":"sha256:87e8ad2a265b6c2f66047c742e612cd8d8617208ba7bb52a75022241cc34a49b","observation_id":"c4bd6c0d-3735-457e-a197-5f642f9620dd","resolution":{"observed_at":"2026-08-02T21:49:09.785134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-02T21:49:09.913148Z","title":"2412.15115","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19101","last_updated":"2026-06-03T08:52:56Z","snapshot_observed_at":"2026-08-06T06:49:38.112037Z","submitted_at":"2026-02-22T09:11:26Z","title":"Value Entanglement: Conflation Between Different Kinds of Good In (Some) Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T21:49:09.913148Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2602.19101"},"observation_digest":"sha256:4dd879373a59d1c18bf71d2a47ece7689f31777dda66faccffa9ec173a0ae83d","observation_id":"bb8a2115-5feb-4a1f-994e-13e4f4bd8724","resolution":{"observed_at":"2026-08-02T21:49:09.913148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11618","last_updated":"2025-06-20T17:23:55Z","snapshot_observed_at":"2026-08-07T07:50:03.690781Z","submitted_at":"2025-06-13T09:39:54Z","title":"Convergent Linear Representations of Emergent Misalignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11618","snapshot_observed_at":"2026-08-02T21:49:09.959136Z","title":"arXiv:2506.11618 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19101","last_updated":"2026-06-03T08:52:56Z","snapshot_observed_at":"2026-08-06T06:49:38.112037Z","submitted_at":"2026-02-22T09:11:26Z","title":"Value Entanglement: Conflation Between Different Kinds of Good In (Some) Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T21:49:09.959136Z"},"links":{"cited_paper":"/paper/2506.11618","citing_paper":"/paper/2602.19101"},"observation_digest":"sha256:df2e51a190bad52deb867d43547621f68d45b39393da76a6701cfec15216f54b","observation_id":"62bc3130-4331-42b5-8127-627d1046e46c","resolution":{"observed_at":"2026-08-02T21:49:09.959136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11613","last_updated":"2025-06-13T09:34:25Z","snapshot_observed_at":"2026-08-07T20:45:04.878203Z","submitted_at":"2025-06-13T09:34:25Z","title":"Model Organisms for Emergent Misalignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11613","snapshot_observed_at":"2026-08-02T21:49:10.039369Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19101","last_updated":"2026-06-03T08:52:56Z","snapshot_observed_at":"2026-08-06T06:49:38.112037Z","submitted_at":"2026-02-22T09:11:26Z","title":"Value Entanglement: Conflation Between Different Kinds of Good In (Some) Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T21:49:10.039369Z"},"links":{"cited_paper":"/paper/2506.11613","citing_paper":"/paper/2602.19101"},"observation_digest":"sha256:80d781caffe2798e4f1e3be45844bdb968a04fcc588c4079ce39229acb873db0","observation_id":"33404c56-3a97-45f9-a987-b6b99de887eb","resolution":{"observed_at":"2026-08-02T21:49:10.039369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-02T21:49:10.093299Z","title":"URL http://arxiv.org/abs/ 2310.01405","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19101","last_updated":"2026-06-03T08:52:56Z","snapshot_observed_at":"2026-08-06T06:49:38.112037Z","submitted_at":"2026-02-22T09:11:26Z","title":"Value Entanglement: Conflation Between Different Kinds of Good In (Some) Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T21:49:10.093299Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2602.19101"},"observation_digest":"sha256:f64be77bef4c1323b80cea81560a251d63dfe4b1dd447936e0b9f0d642e9fad6","observation_id":"d8b0c6ed-3a59-4f74-be19-a4b844c105a5","resolution":{"observed_at":"2026-08-02T21:49:10.093299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:49:10.161724Z","title":"OLEDinstead of going to the optional work event. Neutral $$$$ I chose to watch TV on myLG 65","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2602.19101","last_updated":"2026-06-03T08:52:56Z","snapshot_observed_at":"2026-08-06T06:49:38.112037Z","submitted_at":"2026-02-22T09:11:26Z","title":"Value Entanglement: Conflation Between Different Kinds of Good In (Some) Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T21:49:10.161724Z"},"links":{"citing_paper":"/paper/2602.19101"},"observation_digest":"sha256:83e5099d0644154b20f587909a4816f847b81ea176653e4f4f30d5340c6230ed","observation_id":"6d1233c1-472e-4409-8198-6282c031fdd5","resolution":{"observed_at":"2026-08-02T21:49:10.161724Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-02T21:49:09.271327Z","title":"Betley, J., Tan, D., Warncke, N., Sztyber-Betley, A., Bao, X., Soto, M., Labenz, N., and Evans, O","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19101","last_updated":"2026-06-03T08:52:56Z","snapshot_observed_at":"2026-08-06T06:49:38.112037Z","submitted_at":"2026-02-22T09:11:26Z","title":"Value Entanglement: Conflation Between Different Kinds of Good In (Some) Large Language Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T21:49:09.271327Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2602.19101"},"observation_digest":"sha256:43c62156ffbdb20ecfe2b6ebf318e270f54fa41b856d1b64085fe116eef2730e","observation_id":"bef8f37c-cd31-42e8-a4b3-3b54a546f5e8","resolution":{"observed_at":"2026-08-02T21:49:09.271327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.tics.2023","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:54:29.105969Z","title":"doi: 10.1016/j.tics.2023","venue":null,"work_id":"4a6cf54c-0875-4278-8cc6-d0e08ad00e49","year":2023},"citing_paper":{"arxiv_id":"2602.19101","last_updated":"2026-06-03T08:52:56Z","snapshot_observed_at":"2026-08-06T06:49:38.112037Z","submitted_at":"2026-02-22T09:11:26Z","title":"Value Entanglement: Conflation Between Different Kinds of Good In (Some) Large Language Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T21:49:09.350529Z"},"links":{"citing_paper":"/paper/2602.19101"},"observation_digest":"sha256:2e44e192412717194c939448a0797b95af08bf43442e41b644de4b175bb0b809","observation_id":"d72d5ca9-f660-4242-a164-048a0c90f11d","resolution":{"observed_at":"2026-08-02T21:54:29.151885Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11717","snapshot_observed_at":"2026-08-02T21:49:09.092182Z","title":"Arturi, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19101","last_updated":"2026-06-03T08:52:56Z","snapshot_observed_at":"2026-08-06T06:49:38.112037Z","submitted_at":"2026-02-22T09:11:26Z","title":"Value Entanglement: Conflation Between Different Kinds of Good In (Some) Large Language Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T21:49:09.092182Z"},"links":{"cited_paper":"/paper/2406.11717","citing_paper":"/paper/2602.19101"},"observation_digest":"sha256:966c5c687121559528e9b4b67123dccfe68db6633343efca08aa69ee92605e87","observation_id":"ae547ce6-8ead-4da0-982f-2005f7b6f4b6","resolution":{"observed_at":"2026-08-02T21:49:09.092182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:49:09.167520Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19101","last_updated":"2026-06-03T08:52:56Z","snapshot_observed_at":"2026-08-06T06:49:38.112037Z","submitted_at":"2026-02-22T09:11:26Z","title":"Value Entanglement: Conflation Between Different Kinds of Good In (Some) Large Language Models","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T21:49:09.167520Z"},"links":{"citing_paper":"/paper/2602.19101"},"observation_digest":"sha256:eef19f7726e4b75c2d64c18f249ab1974e295a2e83f114128048d2eecc8bb75d","observation_id":"e1d58311-be77-4314-af1c-edb9ff1d7380","resolution":{"observed_at":"2026-08-02T21:49:09.167520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.19101","last_updated":"2026-06-03T08:52:56Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T06:49:38.112037Z","submitted_at":"2026-02-22T09:11:26Z","title":"Value Entanglement: Conflation Between Different Kinds of Good In (Some) Large Language Models"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 1 inbound Pith citation observation for arXiv:2602.19101."}