{"as_of":"2026-08-09T13:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:34aa6fe47c602518951b66d0faaeb7a79dff6846a5e1c5a500c7756f727e3553","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:44:12.908742Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.22676/citation-record","integrity":"/paper/2607.22676/integrity","json":"/paper/2607.22676/citation-record.json","paper":"/paper/2607.22676"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-02T07:44:08.300365Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:08.300365Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:2061d627626d3893a3dc2c1f6d5b256ac10ce76a734c76ac94b07545238aa551","observation_id":"15c20bf2-6b42-4332-97ca-365fa69fed23","resolution":{"observed_at":"2026-08-02T07:44:08.300365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21046","last_updated":"2026-01-16T20:59:08Z","snapshot_observed_at":"2026-08-01T06:32:44.461162Z","submitted_at":"2025-07-28T17:59:05Z","title":"A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21046","snapshot_observed_at":"2026-08-02T07:44:08.456270Z","title":"A survey of self-evolving agents: What, when, how, and where to evolve on the path to artificial super intelligence.arXiv preprint arXiv:2507.21046,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:08.456270Z"},"links":{"cited_paper":"/paper/2507.21046","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:de20811f34704e2d35973073f0b307f4927cdabaf906e498aa27a6fab04075d4","observation_id":"0b9ed988-c8cd-455e-86de-0ffd23a790bc","resolution":{"observed_at":"2026-08-02T07:44:08.456270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:08.575041Z","title":"Shashwat Goel, Rishi Hazra, Dulhan Jayalath, Timon Willi, Parag Jain, William F Shen, Ilias Leontiadis, Francesco Barbieri, Yoram Bachrach, Jonas Geiping, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:08.575041Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:e4ae99e70d184b5ba631a2bfbba073df574c025f703153cce8fd0147bf41d1d3","observation_id":"4db81838-fe98-44f2-b42a-6cf38c5448e7","resolution":{"observed_at":"2026-08-02T07:44:08.575041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18864","last_updated":"2025-02-26T06:17:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T06:17:13Z","title":"Towards an AI co-scientist","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18864","snapshot_observed_at":"2026-08-02T07:44:08.709873Z","title":"Towards an ai co-scientist.arXiv preprint arXiv:2502.18864,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:08.709873Z"},"links":{"cited_paper":"/paper/2502.18864","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:8351b2b74e84a0e296d123ecd776b409d0a20a983b60b18b64834b351dd49e91","observation_id":"e1d13e2b-96d8-4e02-8bde-7704aebf7b2f","resolution":{"observed_at":"2026-08-02T07:44:08.709873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-02T07:44:08.843992Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:08.843992Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:09080d1e4ee837ab54e11aaa35c9f5be29e32d54935cea898448d7c71c040209","observation_id":"893a902e-5c71-448f-b6ab-b9601a943054","resolution":{"observed_at":"2026-08-02T07:44:08.843992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-02T07:44:08.964328Z","title":"Alignment faking in large language models.arXiv preprint arXiv:2412.14093,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:08.964328Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:3666d0647bfdff4a8aa91560f38afb89a769be26760732a25b04b3dd393a218f","observation_id":"f1c8b897-c2c1-455b-bbcd-af557fd70f26","resolution":{"observed_at":"2026-08-02T07:44:08.964328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17746","snapshot_observed_at":"2026-08-02T07:44:09.041384Z","title":"Rubrics as rewards: Reinforcement learning beyond verifiable domains.arXiv preprint arXiv:2507.17746,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:09.041384Z"},"links":{"cited_paper":"/paper/2507.17746","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:8a26d98aeb4d774c77679f5847238ea295f7f46694c5e6bf98d6de524345a0ec","observation_id":"b686f350-5d9c-45fd-b691-3b5b48c10978","resolution":{"observed_at":"2026-08-02T07:44:09.041384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-02T07:44:09.145063Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:09.145063Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:729e8e59aa83b1a3e38800da20fa7b18af642f17868e4880f6d836b8de3e9efb","observation_id":"67bbd316-71c9-4e0c-aa08-37a9e75ccdb4","resolution":{"observed_at":"2026-08-02T07:44:09.145063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:09.221267Z","title":"Val-bench: Measuring value alignment in language models.arXiv preprint arXiv:2510.05465,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:09.221267Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:c3fe2ccdc22dfd2bdc42ddd3376a29bb567f2cd72b6c831c85035e4e94cafc62","observation_id":"a95bba1c-e718-4851-bb67-d551f67aa950","resolution":{"observed_at":"2026-08-02T07:44:09.221267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01099","last_updated":"2024-08-20T17:54:08Z","snapshot_observed_at":"2026-08-07T19:50:06.174279Z","submitted_at":"2024-04-01T13:12:30Z","title":"What is in Your Safe Data? Identifying Benign Data that Breaks Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01099","snapshot_observed_at":"2026-08-02T07:44:09.310328Z","title":"10 Dan Hendrycks, Collin Burns, Steven Basart, Andy Zou, Mantas Mazeika, Dawn Song, and Jacob Steinhardt","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:09.310328Z"},"links":{"cited_paper":"/paper/2404.01099","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:e51993e783f155be428a222acfe590a0a00ddf7a0c8f752cee19053f75e76ef7","observation_id":"60817586-e035-49c2-9647-8334b689781a","resolution":{"observed_at":"2026-08-02T07:44:09.310328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:09.409877Z","title":"Understanding catastrophic forgetting in language models via implicit inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:09.409877Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:e55eff4b71753e10e55a544e58a461257a3cc426a7f980be53c679faf5a27d50","observation_id":"93edbb92-ec61-45e5-a8d3-97889d1de0cf","resolution":{"observed_at":"2026-08-02T07:44:09.409877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-08-02T07:44:09.563432Z","title":"LoRA fine-tuning efficiently undoes safety training in Llama 2-chat 70b.arXiv preprint arXiv:2310.20624,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:09.563432Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:c80d19254419893fd58c216c24012b718c025d4537d2364ec10bf09e57eabb03","observation_id":"ed4e70e1-67fb-424a-937f-79b556eadb57","resolution":{"observed_at":"2026-08-02T07:44:09.563432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-02T07:44:09.803411Z","title":"Holistic evaluation of language models.arXiv preprint arXiv:2211.09110,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:09.803411Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:d0b388d5f77146007b203c27d5b63a111e4a7a9597e527cbb6fba096f08a9811","observation_id":"cd3fdea8-e9d5-448b-8413-30ca16bb3482","resolution":{"observed_at":"2026-08-02T07:44:09.803411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-02T07:44:09.929971Z","title":"TruthfulQA: Measuring how models mimic human falsehoods.arXiv preprint arXiv:2109.07958,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:09.929971Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:3262c7c8375bfea3bd2d0fab1c28cee6ea51c4d8049dea1e1c43c2b31c506b44","observation_id":"fa646ea2-3a36-4082-bb39-13ac93b65480","resolution":{"observed_at":"2026-08-02T07:44:09.929971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:10.066489Z","title":"Natural emergent misalignment from reward hacking in production RL.arXiv preprint arXiv:2511.18397,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:10.066489Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:f44938883ee727bb0e9709c5e0c1f6c8c4457e7629aa6bdf2ef97e4e01867db8","observation_id":"7f1373da-6470-4aa8-8236-455916a01d57","resolution":{"observed_at":"2026-08-02T07:44:10.066489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-02T07:44:10.182971Z","title":"HarmBench: A standardized evaluation framework for automated red teaming and robust refusal","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:10.182971Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:56d8ad722eb71de12bb33b8754e49479a6668914e6743a3ec185f6c9605a5028","observation_id":"ac092efd-0bf9-41b7-8ef4-d2f87a8cea56","resolution":{"observed_at":"2026-08-02T07:44:10.182971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.00133","last_updated":"2020-09-30T22:38:40Z","snapshot_observed_at":"2026-08-01T09:26:19.649537Z","submitted_at":"2020-09-30T22:38:40Z","title":"CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.00133","snapshot_observed_at":"2026-08-02T07:44:10.447865Z","title":"Long Ouyang, Jeffrey Wu, Xu Jiang, Diogo Almeida, Carroll L","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:10.447865Z"},"links":{"cited_paper":"/paper/2010.00133","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:19ccf316966d4da03e8ae1c787074cc19e597448ea34d0ee3ed44d532c63e070","observation_id":"da97eac8-1fb3-4ae9-8c6b-0d23d3ed6c0e","resolution":{"observed_at":"2026-08-02T07:44:10.447865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06681","last_updated":"2024-07-05T15:30:45Z","snapshot_observed_at":"2026-08-07T14:28:06.805424Z","submitted_at":"2023-12-09T04:40:46Z","title":"Steering Llama 2 via Contrastive Activation Addition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06681","snapshot_observed_at":"2026-08-02T07:44:10.618734Z","title":"Steering Llama 2 via contrastive activation addition.arXiv preprint arXiv:2312.06681,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:10.618734Z"},"links":{"cited_paper":"/paper/2312.06681","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:60e8e8634533ae49306364982b078b82ebe17c7314ead972d5c167c9c93dc07c","observation_id":"18ae449e-e1b3-4d26-bef0-54597ca2b9c6","resolution":{"observed_at":"2026-08-02T07:44:10.618734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08193","last_updated":"2022-03-16T01:35:45Z","snapshot_observed_at":"2026-07-06T11:58:21.596920Z","submitted_at":"2021-10-15T16:43:46Z","title":"BBQ: A Hand-Built Bias Benchmark for Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08193","snapshot_observed_at":"2026-08-02T07:44:10.724281Z","title":"11 Ethan Perez, Sam Ringer, Kamile Lukosiute, Karina Nguyen, Edwin Chen, Scott Heiner, Craig Pettit, Catherine Olsson, Sandipan Kundu, and Saurav Kadavath","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:10.724281Z"},"links":{"cited_paper":"/paper/2110.08193","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:385bb638320dc262f2054571e8d3147f71b9fe5a6145c0bffb2f299a4a401887","observation_id":"2a7d4085-942d-4811-a70d-16f853adca04","resolution":{"observed_at":"2026-08-02T07:44:10.724281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.01420","last_updated":"2025-07-03T17:52:47Z","snapshot_observed_at":"2026-08-07T15:56:59.017435Z","submitted_at":"2025-05-02T17:57:14Z","title":"Evaluating Frontier Models for Stealth and Situational Awareness","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.01420","snapshot_observed_at":"2026-08-02T07:44:10.876626Z","title":"Evaluating frontier models for stealth and situational awareness.arXiv preprint arXiv:2505.01420,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:10.876626Z"},"links":{"cited_paper":"/paper/2505.01420","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:27aea35838e1d758e2f032c078efe8a2344d63caae81e82a2f916808b1dc5946","observation_id":"e611791f-350a-4d55-914d-eda50aacda53","resolution":{"observed_at":"2026-08-02T07:44:10.876626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-02T07:44:10.978883Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to!arXiv preprint arXiv:2310.03693,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:10.978883Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:af68a9af329275efa54ab136ab16990ed5e7ef79a2edb7051189a9de7de3ed4c","observation_id":"a909cb6d-3143-4ced-a1df-19e32ac9708d","resolution":{"observed_at":"2026-08-02T07:44:10.978883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-02T07:44:11.097152Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:11.097152Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:7d148fc935acb5a9f1f10184ff0658447d1e9adfa9ea2c34c8dc68a3c50c360c","observation_id":"2d90204a-e197-4ddb-829f-a2dc575a1c93","resolution":{"observed_at":"2026-08-02T07:44:11.097152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:11.291461Z","title":"Towards understanding sycophancy in language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:11.291461Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:f03f7b31f7aece1cc4267b7862a1775ccfff2b2609d8897f40e321d9ffc46869","observation_id":"faa928a4-7c31-4015-a6e7-8f38383d3c1d","resolution":{"observed_at":"2026-08-02T07:44:11.291461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14387","last_updated":"2026-04-20T20:19:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-17T10:33:23Z","title":"SEAT: Sparse Entity-Aware Tuning for Knowledge Adaptation while Preserving Epistemic Abstention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14387","snapshot_observed_at":"2026-08-02T07:44:11.373496Z","title":"Llm unlearning via neural activation redirection.Advances in Neural Information Processing Systems, 38:44253–44290, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:11.373496Z"},"links":{"cited_paper":"/paper/2506.14387","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:296cb5158c373de067582cab2d837ae818388e7be6c13c989eb22c1dbe8ca227","observation_id":"9799853d-1213-49ec-9fed-4a72e5596838","resolution":{"observed_at":"2026-08-02T07:44:11.373496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:11.472483Z","title":"Rethinking rubric generation for improving llm judge and reward modeling for open-ended tasks.arXiv preprint arXiv:2602.05125, 2026b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:11.472483Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:8795fe1f38b83865e87928a9dd670e3ee1d186563e8820b7fa3170560666206a","observation_id":"ecc72661-25ad-4704-bebd-5a06674b1d0d","resolution":{"observed_at":"2026-08-02T07:44:11.472483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:11.574118Z","title":"Efficiency vs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:11.574118Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:93afdf63e090f1c13813c5fa44668026c9001db269abefd03cbf9b0754ca04d8","observation_id":"f4383b94-2b9f-4d14-9b4a-b5ffc5bd0505","resolution":{"observed_at":"2026-08-02T07:44:11.574118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.29358","last_updated":"2026-05-28T04:57:47Z","snapshot_observed_at":"2026-07-06T23:38:46.361360Z","submitted_at":"2026-05-28T04:57:47Z","title":"Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.29358","snapshot_observed_at":"2026-08-02T07:44:11.683306Z","title":"Scaling monosemanticity: Extracting interpretable features from claude 3 sonnet.arXiv preprint arXiv:2605.29358,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:11.683306Z"},"links":{"cited_paper":"/paper/2605.29358","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:d3cd2d455f1eb71d3522374d128aee75fc23350b96173723f663055462c1e2f2","observation_id":"2a576681-4e36-4855-a189-130589f46210","resolution":{"observed_at":"2026-08-02T07:44:11.683306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-09T05:14:36.079509Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-02T07:44:11.904578Z","title":"Reinforcement learning with verifiable rewards implicitly incentivizes correct reasoning in base llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:11.904578Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:04c7cf4f2a41220928227586ae9cea4733c8eb53e0fffa0a1b5b9f8123c3570f","observation_id":"2ccb2f31-6291-4be4-81d2-34523d9259e8","resolution":{"observed_at":"2026-08-02T07:44:11.904578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01364","last_updated":"2024-02-07T07:14:39Z","snapshot_observed_at":"2026-08-04T18:35:41.659861Z","submitted_at":"2024-02-02T12:34:09Z","title":"Continual Learning for Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01364","snapshot_observed_at":"2026-08-02T07:44:11.986628Z","title":"Continual learning for large language models: A survey.arXiv preprint arXiv:2402.01364,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:11.986628Z"},"links":{"cited_paper":"/paper/2402.01364","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:12dbea47634c2165138ac22088958c044c35a669e98b6ac7cfdb0e0fcb9db76b","observation_id":"44ce3f33-e5bb-444d-b68f-21fc76dd0456","resolution":{"observed_at":"2026-08-02T07:44:11.986628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-02T07:44:12.128064Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:12.128064Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:a236a93740c79d029cd3f48e282bb045028e297e4ed886308ac5624317d017de","observation_id":"c758f0d3-8683-4048-894a-f186754125ba","resolution":{"observed_at":"2026-08-02T07:44:12.128064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-02T07:44:12.204085Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:12.204085Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:fd3fc8ecb4aed6251173b08f6a63710ca01a2a49901c85092fc9d98f9dc11271","observation_id":"3282e5e5-ac55-46e1-aca2-a48f7d1b8956","resolution":{"observed_at":"2026-08-02T07:44:12.204085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02949","last_updated":"2023-10-04T16:39:31Z","snapshot_observed_at":"2026-08-07T11:20:01.991656Z","submitted_at":"2023-10-04T16:39:31Z","title":"Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02949","snapshot_observed_at":"2026-08-02T07:44:12.284016Z","title":"Shadow alignment: The ease of subverting safely-aligned language models.arXiv preprint arXiv:2310.02949,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:12.284016Z"},"links":{"cited_paper":"/paper/2310.02949","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:0f11b7de0dbf30af2f38ce84d7de2a5bc628d1594d8eb9e5ec1e66c9545e7fce","observation_id":"6dc0aa6b-640a-4bd9-8fbc-554c13c04373","resolution":{"observed_at":"2026-08-02T07:44:12.284016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-02T07:44:12.338931Z","title":"Junhao Zheng, Shengjie Qiu, Chengming Shi, and Qianli Ma","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:12.338931Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:43b88d5c0098f5cce88344deb921b4063f8b439a2dfee62b5cdc377bc8725fc8","observation_id":"0bc464dc-398e-45a6-a3c0-388d06036cc7","resolution":{"observed_at":"2026-08-02T07:44:12.338931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-02T07:44:12.407447Z","title":"Instruction-following evaluation for large language models.arXiv preprint arXiv:2311.07911,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:12.407447Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:7f3970d6d92ef7410f2e7ae857b24b0b32423a9f6bb134687c0cf77a465859ee","observation_id":"af3ebd5a-7c02-4ae3-8603-1ef177ca39df","resolution":{"observed_at":"2026-08-02T07:44:12.407447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:12.507333Z","title":"The path not taken: RLVR provably learns off the principals.arXiv preprint arXiv:2511.08567,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:12.507333Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:9683a78e53c0a5dcd404edd4ab52384e2e29b5a4c295c69d2bad6c0da715c4fc","observation_id":"67ea0e6d-4bc8-479c-8011-a47dc483ee69","resolution":{"observed_at":"2026-08-02T07:44:12.507333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-02T07:44:12.594577Z","title":"Representation engineering: A top-down approach to ai transparency.arXiv preprint arXiv:2310.01405,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:12.594577Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:09baa4f31ac0dfd1d7d0941a4a77fb9bf90e6a543eb78f8b46c509b8fb44b52a","observation_id":"dd97763e-1c09-4b9f-824d-79d1451e595e","resolution":{"observed_at":"2026-08-02T07:44:12.594577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:12.714401Z","title":"15 A.2 KL-Regularized SFT","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:12.714401Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:151782494652fd62c6a233ecb17421cc310d22f75fad103abf4da4280db7efa6","observation_id":"0bb0f0b0-23d6-40c2-a88b-c47c2bfe9f17","resolution":{"observed_at":"2026-08-02T07:44:12.714401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:12.794413Z","title":"GRPO-based RLVR is trained to a fixed number of steps with almost all reaching reward saturation, while SFT and KL-SFT use the fixed epoch budgets in Table","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:12.794413Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:3e07d994ab5495e8f68c4a7c3b4e3ee216dada65ab59e46566ea1409e5d67acb","observation_id":"29f6243c-f362-4ae0-8bd9-ab00a9b7110f","resolution":{"observed_at":"2026-08-02T07:44:12.794413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:12.861870Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:12.861870Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:a6f00db7dca4d4b585144fef9923830065a239c68b8758bf119d4d0af3ebf6c1","observation_id":"21c96e9d-c54a-45a6-873c-e0280e23026d","resolution":{"observed_at":"2026-08-02T07:44:12.861870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:12.908742Z","title":"We report the headline metric, the preferred direction, and the aggregation procedure used when benchmarks contain multiple subtasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:12.908742Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:0f931d1ceca70253cc2592fb64274a7dbc4c8d6d369cdafe4753cff74c62a688","observation_id":"240f51fc-e227-4227-86ff-10f2289e7486","resolution":{"observed_at":"2026-08-02T07:44:12.908742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-02T07:44:11.200447Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:11.200447Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:c4eb9b7cfa28ae1bfbc0a5adcf1f54bf15e56ab7100695a547e03c94733304d4","observation_id":"e9305019-ea83-44a8-a90a-13cdd5fe1d29","resolution":{"observed_at":"2026-08-02T07:44:11.200447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:10.281592Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:10.281592Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:0ef3e5a0f2668d0508ae44132007215dd257f56129044efc205021554f2fd8e2","observation_id":"47ed0b9f-43c9-4d4a-b30e-33b65240793b","resolution":{"observed_at":"2026-08-02T07:44:10.281592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:08.124547Z","title":"Breaking the safety-capability tradeoff: Reinforcement learning with verifiable rewards maintains safety guardrails in LLMs.arXiv preprint arXiv:2511.21050,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:08.124547Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:26dbf917522ac735526897d2e6d10ad0019b5fa0ed0afdea72cd8ec91ad8d99b","observation_id":"53feb5b4-32ca-43f4-b1cf-38789ac341f3","resolution":{"observed_at":"2026-08-02T07:44:08.124547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14852","last_updated":"2023-12-27T10:09:18Z","snapshot_observed_at":"2026-07-06T17:07:14.412645Z","submitted_at":"2023-12-22T17:25:42Z","title":"TACO: Topics in Algorithmic COde generation dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14852","snapshot_observed_at":"2026-08-02T07:44:09.658983Z","title":"Taco: Topics in algorithmic code generation dataset.arXiv preprint arXiv:2312.14852,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:09.658983Z"},"links":{"cited_paper":"/paper/2312.14852","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:d71ccdbcb02fc2b4dd418db61365cb8161a4eb9d874eb3c24e2def808657935c","observation_id":"2f170256-bcb4-45cb-b0a5-042892823d5f","resolution":{"observed_at":"2026-08-02T07:44:09.658983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05386","last_updated":"2026-06-29T17:47:49Z","snapshot_observed_at":"2026-08-06T19:25:14.929252Z","submitted_at":"2025-07-07T18:17:06Z","title":"Reinforcement Fine-Tuning Naturally Mitigates Forgetting in Continual Post-Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05386","snapshot_observed_at":"2026-08-02T07:44:09.499800Z","title":"Reinforcement fine-tuning naturally mitigates forgetting in continual post-training.arXiv preprint arXiv:2507.05386,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:09.499800Z"},"links":{"cited_paper":"/paper/2507.05386","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:7cc11cb7a8f835ab8e9939b4edeeb61ee91a0685b3afb7419c0bc991195c907a","observation_id":"715f6f3d-a357-440f-8bbd-1efd2c690acf","resolution":{"observed_at":"2026-08-02T07:44:09.499800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-02T07:44:07.870753Z","title":"Program synthesis with large language models.arXiv preprint arXiv:2108.07732,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:07.870753Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:a2f861a19913d5a69d66e71a1a2998d2ebc6c72f74c71d6a42717c3fac91cba0","observation_id":"c2b3e20b-dbc5-4ab0-8f0f-77258d1ed2fb","resolution":{"observed_at":"2026-08-02T07:44:07.870753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-02T07:44:07.946955Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:07.946955Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:d9eb8a916e635156efb785f2e8c9f097378458f0710eff3b17aec847f98429d6","observation_id":"be94e655-cd29-4999-9bef-8b9fb268711a","resolution":{"observed_at":"2026-08-02T07:44:07.946955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:44:11.838709Z","title":"Persona features control emergent misalignment.arXiv preprint arXiv:2506.19823,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:11.838709Z"},"links":{"citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:8edd5bbd93893412df966bb564489b02e1587a59151736ca64deb07b60416b72","observation_id":"ca54fa19-a4f1-410c-986d-48769cb5dcee","resolution":{"observed_at":"2026-08-02T07:44:11.838709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T00:13:13.652423Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2607.22676."}