{"as_of":"2026-08-10T04:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:26ca013018bd4a318f53dbfe7f22709c500a752c82570f932b7e58f2055beec6","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:12:00.573379Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:53:40.719452Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T14:19:53.912897Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16178","snapshot_observed_at":"2026-08-05T20:53:40.719452Z","title":"up-word-down-label","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09824","last_updated":"2025-08-15T01:40:46Z","snapshot_observed_at":"2026-08-09T21:15:28.788403Z","submitted_at":"2025-08-13T13:56:01Z","title":"Reverse Convolution and Its Applications to Image Restoration","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T20:53:40.719452Z"},"links":{"cited_paper":"/paper/2505.16178","citing_paper":"/paper/2508.09824"},"observation_digest":"sha256:3e771448e2ba21baeab0a9d03c3b0eac436c052ac5cf50225f49cb3001638d96","observation_id":"aa3b18c5-23ec-47e6-9973-0621f72de720","resolution":{"observed_at":"2026-08-05T20:53:40.719452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"cited_work":{"arxiv_id":"2505.16178","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16178","snapshot_observed_at":"2026-07-04T14:19:53.912897Z","title":"Understanding fact recall in language models: Why two-stage training encourages memorization but mixed training teaches knowledge","venue":"cs.CL","work_id":"e5f336ec-4763-4dc4-84a2-72f3100f1755","year":2025},"citing_paper":{"arxiv_id":"2510.26745","last_updated":"2026-05-18T17:56:38Z","snapshot_observed_at":"2026-08-02T20:19:54.425869Z","submitted_at":"2025-10-30T17:40:22Z","title":"Deep sequence models tend to memorize geometrically; it is unclear why","version":3},"reference_index":202,"source":"pdf_text","source_observed_at":"2026-05-21T20:38:18.005002Z"},"links":{"cited_paper":"/paper/2505.16178","citing_paper":"/paper/2510.26745"},"observation_digest":"sha256:8a92cc746c8fd1c2e005f66b92acbafc0089c7989da1f6e1c92a460b7ad4d6fc","observation_id":"05210f89-4f2d-46d8-bc3a-8c44449424cb","resolution":{"observed_at":"2026-05-29T02:04:53.815446Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"cited_work":{"arxiv_id":"2505.16178","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16178","snapshot_observed_at":"2026-07-04T14:19:53.912897Z","title":"Understanding fact recall in language models: Why two-stage training encourages memorization but mixed training teaches knowledge","venue":"cs.CL","work_id":"e5f336ec-4763-4dc4-84a2-72f3100f1755","year":2025},"citing_paper":{"arxiv_id":"2606.27237","last_updated":"2026-08-06T12:36:42Z","snapshot_observed_at":"2026-08-09T23:12:18.100076Z","submitted_at":"2026-06-25T16:22:43Z","title":"LMs as Task-Specific Knowledge Bases: An Interpretability Analysis","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-06-26T04:15:31.054780Z"},"links":{"cited_paper":"/paper/2505.16178","citing_paper":"/paper/2606.27237"},"observation_digest":"sha256:6a970bf919883fb17d3b0d355cb6ce19881a0bbfc44b3c775c53285fdaf172a5","observation_id":"3034ac67-e9b9-42a3-b4a9-feed42715713","resolution":{"observed_at":"2026-07-04T14:19:53.914287Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16178/citation-record","integrity":"/paper/2505.16178/integrity","json":"/paper/2505.16178/citation-record.json","paper":"/paper/2505.16178"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.904197Z","title":"Evaluating correctness and faithfulness of instruction-following models for question answering","venue":null,"work_id":"7a97044c-3d6e-4041-904c-9da42a5c0c14","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:55.400714Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:bac6c96b78b189122f54137038285b01acafb63aa54e261c619071dd860886d4","observation_id":"b3b0063e-b53a-4442-9ee6-3de35ee46ad9","resolution":{"observed_at":"2026-08-07T15:12:02.909216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:11:55.475764Z","title":"Llama 3.2: Revolutionizing edge ai and vision with open, customizable models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:55.475764Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:138d79518dcaafad21dad59ac11bf971a17eb1cb924c17974997f6a1cd84d192","observation_id":"9cc26fe9-fad4-4789-b343-d91b52fa66f7","resolution":{"observed_at":"2026-08-07T15:11:55.475764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.875374Z","title":"Physics of language models: Part 3.1, knowledge storage and extraction","venue":null,"work_id":"1fd52df9-8ef6-4e71-ac94-68c4db0ede3f","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:55.592211Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:80df7e9e326628eabc0758044bcf1d18b2cc3c7a99dcb9ac6bf29e51a17f2ea0","observation_id":"e41ee26d-26d9-4ee4-a093-efb3b83ee40f","resolution":{"observed_at":"2026-08-07T15:12:02.881252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.859951Z","title":"Physics of language models: Part 3.2, knowledge manipula- tion","venue":null,"work_id":"89d09260-c568-487c-bdc0-c3dcfbfaa90d","year":2025},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:55.743068Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:9c640e8e7e0a23c3f06ab0ba903aa41bdbb8f6d7b77ca5da41dba0cf42d1195c","observation_id":"13869605-8315-40d7-b021-776c72b2b662","resolution":{"observed_at":"2026-08-07T15:12:02.865284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.844494Z","title":"Towards better understanding of gradient-based attribution methods for deep neural networks","venue":null,"work_id":"c10dcc02-6f93-43a8-ad5f-50b805126ce4","year":2018},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:55.839999Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:bfa1b9388f3f675db724ac8943663a92a7a62819b35e7b32288b25ada2037b5c","observation_id":"59b507d6-e94e-4515-be59-e36ee589cdf8","resolution":{"observed_at":"2026-08-07T15:12:02.849487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T15:11:55.947350Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:55.947350Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:806749177939274a2026dbd93f059a441f35c3926109063ee2d9b26878ff5fe5","observation_id":"bb00f3c9-52e9-4000-9e30-a8303963cfb8","resolution":{"observed_at":"2026-08-07T15:11:55.947350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.828173Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":"a9b5ac2c-7063-4ea0-89be-c1b9626dbd48","year":2023},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:56.060845Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:4898328a5892b31f74f7327f83a8619e00069ae8fb5585a4a7bc154747796016","observation_id":"2d020124-f740-4d2c-9053-8bb795e7911c","resolution":{"observed_at":"2026-08-07T15:12:02.833474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.812096Z","title":"Instructpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"c9ffc339-c600-407c-aa6e-7b2caec1c006","year":2023},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:56.209417Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:f8d50a82573aaaa82c71309d5b8dc030c7787b39653610179e4bcdcda8792c9f","observation_id":"195992c6-268c-442d-8397-2f86538a3eff","resolution":{"observed_at":"2026-08-07T15:12:02.817716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:11:56.397434Z","title":"Causal scrubbing: A method for rigorously testing interpretability hypotheses","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:56.397434Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:3639fc0ca43cf20f56cb7b7975cbe3b9cbb1dab6a9a31c2d1b79dc72fc174687","observation_id":"2360e71c-2c40-47e3-ae0a-0bc67a629fff","resolution":{"observed_at":"2026-08-07T15:11:56.397434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.784163Z","title":"Journey to the center of the knowledge neurons: Discoveries of language-independent knowledge neurons and degenerate knowledge neurons","venue":null,"work_id":"7d976344-1698-4d8f-ac04-cbbb929163c8","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:56.530960Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:2b018be19e851fe55e761de3cb6af33e992081286fbcea44eca4929f05c4c977","observation_id":"6a5d02bf-22bf-4698-b299-fe3e35741a63","resolution":{"observed_at":"2026-08-07T15:12:02.790929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.766719Z","title":"Instruc- tion pre-training: Language models are supervised multitask learners","venue":null,"work_id":"b7791f0e-8b8b-4045-9488-90d875c8aea8","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:56.613248Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:870a751b5e616547e4d7253a066d38ce2f35cbf65ad606d728dda7c350e09097","observation_id":"8d2b9e9e-e811-48bf-9e9b-738bea0e7407","resolution":{"observed_at":"2026-08-07T15:12:02.772342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.750481Z","title":"Zhao, Yanping Huang, Andrew M","venue":null,"work_id":"e1483bda-4a19-46b2-8e8f-a3bb4efa6358","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:56.734483Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:217dda92c7a1d2639632b757acc6730066161834d8cce53bc83ce4e1172686b4","observation_id":"4c73c785-e1a6-4ccb-a084-1ae57e33ea00","resolution":{"observed_at":"2026-08-07T15:12:02.756083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.734199Z","title":"Towards automated circuit discovery for mechanistic interpretability","venue":null,"work_id":"f3165107-caa7-4a86-b82b-b46f81c3e90f","year":2023},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:56.810407Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:3923394e793b80a753859b352de2a39d5419d35086c0537acf1cad48492d599d","observation_id":"dd64acd9-f7d6-45cb-aa59-4472c17c6751","resolution":{"observed_at":"2026-08-07T15:12:02.740201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:11:56.908529Z","title":"Free dolly: Introducing the world’s first truly open instruction-tuned llm, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:56.908529Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:5d8c02886a81567fda34580d13900c072b338bda372ac3e38bbcfa464ee14fa2","observation_id":"7b27cf0d-cc75-4629-9085-66d95b2803c0","resolution":{"observed_at":"2026-08-07T15:11:56.908529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.706724Z","title":"Knowledge neurons in pretrained transformers","venue":null,"work_id":"9197efaa-4728-4f1e-b049-ea59657009cd","year":2022},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:57.000343Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:019d95dc8e6ab73ab45d89a205a71f80e34f7fa676c04023c5c4858072c48672","observation_id":"9897528a-d134-4077-9dbb-06064f5b0d74","resolution":{"observed_at":"2026-08-07T15:12:02.712936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:11:57.093543Z","title":"InstructBLIP: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:57.093543Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:c1f8eba3dc045a9a7f994c549214de28422fbbb5a092a86cc6469bd7367dd430","observation_id":"4554704a-1992-437f-993f-6e83a25c1ccf","resolution":{"observed_at":"2026-08-07T15:11:57.093543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T15:11:57.187657Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:57.187657Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:4df5bf4171e7aaf2928e6e87fa82c3bc353f06417b9d451a767044209c88992b","observation_id":"a587e94d-0051-49f0-9fe2-5f29f904ea42","resolution":{"observed_at":"2026-08-07T15:11:57.187657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.680551Z","title":"Not all lan- guage model features are one-dimensionally linear","venue":null,"work_id":"694ad2d6-916e-43dd-94e8-0edc8f36d8ea","year":2025},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:57.263179Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:36df4c21ded3fd75e06a2c54d489ad4d7347259b43ded4e77b741ebca13b5ea0","observation_id":"8cd11863-fa31-430d-9e75-cd0bb50109e5","resolution":{"observed_at":"2026-08-07T15:12:02.685879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.664920Z","title":"Dissecting recall of factual associations in auto-regressive language models","venue":null,"work_id":"84a6ab66-7871-4bef-9104-9124951ce457","year":2023},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:57.331092Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:05560bc199d3364c5315863be79291cc0c838a1f62ce654597e01e1383340805","observation_id":"d014f255-0e16-448a-a806-e21eaa130da2","resolution":{"observed_at":"2026-08-07T15:12:02.670692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.646848Z","title":"Understanding finetuning for factual knowledge extraction","venue":null,"work_id":"cc3b7f95-0a27-4dba-bba3-5f744337ee35","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:57.437875Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:e7dc3c27a44e310adf9bc7c5343fcaa8b63b829cfb8e8c6c0820ddb5e7fc2fb0","observation_id":"81677c5e-c886-498b-92d1-b341063cfaa4","resolution":{"observed_at":"2026-08-07T15:12:02.653178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.631595Z","title":"Reverse training to nurse the reversal curse","venue":null,"work_id":"2be6df7d-09d6-4a3f-8bd9-7de1b2163394","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:57.525013Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:199430215a71f50da050bc520505c093385409a4087c19666ee525723803655e","observation_id":"6525eaa8-741a-46dd-9d05-2d331af21aa8","resolution":{"observed_at":"2026-08-07T15:12:02.636324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.615728Z","title":"Universal neurons in GPT2 language models.Transactions on Machine Learning Research, 2024","venue":null,"work_id":"4ca3c26d-1b76-48e8-867f-cf4b6d9dfa6b","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:57.598713Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:0174c3b1e0503211eddf3fc87ba20e4f5fbcb73b4c1aff04bb11c81d3fb4331a","observation_id":"0c080acd-9d5b-4cbf-9ee5-09248da88793","resolution":{"observed_at":"2026-08-07T15:12:02.620553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.597719Z","title":"Finding neurons in a haystack: Case studies with sparse probing","venue":null,"work_id":"38b4c36d-3868-404b-9c98-5706d44fd44a","year":2023},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:57.673664Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:2ddf1dae6d89147825e772565e054f1f4489df5391775c9239db8c4be0c611a4","observation_id":"b3a2cf25-4c7d-4583-9365-fe5ad4d26828","resolution":{"observed_at":"2026-08-07T15:12:02.603736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.582224Z","title":"Language models represent space and time","venue":null,"work_id":"8eab78ca-9e64-4994-8d59-282e4b87bac3","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:57.729883Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:274e5f3331ba23d5200e236b67c1d61dd7577a4dae58b25837dbf3950c51f90c","observation_id":"8bc5750b-3486-45c9-867a-40dd8d54e304","resolution":{"observed_at":"2026-08-07T15:12:02.587439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.566806Z","title":"Language models as knowledge bases: On entity rep- resentations, storage capacity, and paraphrased queries","venue":null,"work_id":"3de1f148-778c-4c72-8213-35d2063ff011","year":2021},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:57.759919Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:ea78ff74e6305d3506c3d7e5119cf40e3029bfd592e19e60c82150e2a14200d8","observation_id":"22c0e65d-3d6c-4eb0-816d-d556c3b90c6f","resolution":{"observed_at":"2026-08-07T15:12:02.571711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.550334Z","title":"Monotonic representation of numeric attributes in language models","venue":null,"work_id":"1d57e31b-e7a4-45e8-8e6c-fae827b91e40","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:57.814650Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:7d8ea81904cde60ff1ea5e31ffaa8880cd433c2c7a61ab07633b3dc5ae7b216d","observation_id":"973a03e0-521d-4407-b949-a848c30e6469","resolution":{"observed_at":"2026-08-07T15:12:02.555651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.533137Z","title":"Linearity of relation decoding in transformer language models","venue":null,"work_id":"737b8629-3bb2-4250-8c53-3511c0ceb7b6","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:57.894251Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:e3553677a7da1f65e4ad96df0a88124a4640d06c1e35ec75ff94ab31296a3c20","observation_id":"7e95b614-8cc0-44ea-97da-1c9198c764b0","resolution":{"observed_at":"2026-08-07T15:12:02.539743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.515016Z","title":"Dick, Hidenori Tanaka, Tim Rocktäschel, Edward Grefenstette, and David Krueger","venue":null,"work_id":"81094d39-d1ea-463b-abb7-a28f0c0ba8fa","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:57.982625Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:9715c48bb2b66979f8eab46ad1a463c0b0e48ba3b5d6fb5ed621e4dbec735fe8","observation_id":"20f5776f-811d-4278-b22c-e03aa1035aa0","resolution":{"observed_at":"2026-08-07T15:12:02.520710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.497358Z","title":"Instruction-tuned language models are better knowledge learners","venue":null,"work_id":"4917bcc9-edeb-4d97-8849-afa661e7924b","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:58.082071Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:7531189ac00a7f68084beee1beb8118025c06aabbed92fb0aef63bdb0908dc14","observation_id":"3e72995e-9a5b-4270-9341-77e4e3c04a08","resolution":{"observed_at":"2026-08-07T15:12:02.502964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.481928Z","title":"Backward lens: Projecting language model gradients into the vocabulary space","venue":null,"work_id":"d31a7155-42eb-4afd-b5e9-9a8fbb11937f","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:58.152729Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:0edf76dde0a23c7e007ba01c98fb94587a95947f7558efdc9d56f92b95f7d83a","observation_id":"6527b1a8-f8f4-4b71-b4c3-b756d54108a3","resolution":{"observed_at":"2026-08-07T15:12:02.486954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.465299Z","title":"The remarkable robustness of LLMs: Stages of inference? In ICML 2024 Workshop on Mechanistic Interpretability, 2024","venue":null,"work_id":"3ce40e59-c57b-48b8-b35d-4fa7ad4e7391","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:58.265444Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:8011d80b33658a2bee3b63ef887591665b83d5a44751397f45fa050a4b2b322b","observation_id":"a4e94535-4f2c-4890-92bc-8106a40b3e26","resolution":{"observed_at":"2026-08-07T15:12:02.470762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.08220","last_updated":"2017-01-10T01:40:51Z","snapshot_observed_at":"2026-08-08T03:37:05.499811Z","submitted_at":"2016-12-24T21:36:07Z","title":"Understanding Neural Networks through Representation Erasure","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.08220","snapshot_observed_at":"2026-08-07T15:11:58.343008Z","title":"Understanding neural networks through representation erasure","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:58.343008Z"},"links":{"cited_paper":"/paper/1612.08220","citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:e60b7a1e5098c2568e70ef43bd8aa073fb146a292fc1d33e483f872b172a3ce2","observation_id":"5697e7b4-3679-4e45-8f6c-e3dda5db059b","resolution":{"observed_at":"2026-08-07T15:11:58.343008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.447045Z","title":"Relation also knows: Rethinking the recall and editing of factual associations in auto-regressive transformer language models","venue":null,"work_id":"febf1595-c450-45ee-8ba7-30517de3d3d3","year":2025},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:58.433768Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:d638844c0a2f39102eb15091e3a42c909d33c3d1c92c0da89fff6d3a099fdf09","observation_id":"f75e0658-dc31-4ad4-b295-7a3d5e5e856f","resolution":{"observed_at":"2026-08-07T15:12:02.452936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:11:58.484298Z","title":"The flan collection: Designing data and methods for effective instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:58.484298Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:1afb4086b433d0635561ab6d8f6fff07d4dde07d8ce6ed8c6c6c860612505204","observation_id":"7608ad4a-b913-4aa0-8d5e-a3094aef8c41","resolution":{"observed_at":"2026-08-07T15:11:58.484298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.419485Z","title":"Can neural network memorization be localized? In International Conference on Machine Learning, pages 23536–23557","venue":null,"work_id":"4c1e7617-5480-4404-b45f-1e1d87d09140","year":2023},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:58.568097Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:86178545390c296f8920d74dd1e4136aaadfd7c4c9c29b1f68609cbe7f59a412","observation_id":"d0a9076d-61a8-4aeb-82bf-3eb84095e623","resolution":{"observed_at":"2026-08-07T15:12:02.425608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.404208Z","title":"The geometry of truth: Emergent linear structure in large language model representations of true/false datasets","venue":null,"work_id":"285d61ae-dfa1-4b1a-9140-c82141cd7d31","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:58.657427Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:e2cc9de55ee5112bbfa30f08909ee1009c0b5dc637d413e0bf385c8196b98c29","observation_id":"0f22006f-a7a4-4463-b145-45de7dda21d2","resolution":{"observed_at":"2026-08-07T15:12:02.408933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.388519Z","title":"Locating and editing factual associations in gpt","venue":null,"work_id":"121aadc7-44ad-40e1-9543-40eac1f3a5ff","year":2022},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:58.733736Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:4e57b4e5c8acea84b673a0beafe075c2975476cc29cd88eebb162fd1318b508d","observation_id":"324e89a1-f10f-4586-9dd0-570cf88c1f6d","resolution":{"observed_at":"2026-08-07T15:12:02.393825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.371864Z","title":"What does the knowledge neuron thesis have to do with knowledge? In International Conference on Learning Representations, 2024","venue":null,"work_id":"4253fa01-734b-47a7-b4da-31c85ef7a1a7","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:58.820024Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:20b5907c8f606bbf26c0f93ac154f7555e80515e3a8434def20d98589a461413","observation_id":"5a7c8702-a860-4522-b987-39873f52e014","resolution":{"observed_at":"2026-08-07T15:12:02.377428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.356476Z","title":"Interpreting gpt: the logit lens","venue":null,"work_id":"831b41bf-de5a-4840-91d6-dd69408a2b74","year":2020},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:58.910156Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:d8c51a70c83827c5b454bbac208bf3264e3ca2cd2b69ebbe1c5eed71346e5355","observation_id":"6678ca99-ffef-4e82-804c-8c5b97384f26","resolution":{"observed_at":"2026-08-07T15:12:02.361530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.339805Z","title":"Competition of mechanisms: Tracing how language models handle facts and coun- terfactuals","venue":null,"work_id":"dca003db-f1a3-42cc-94ab-e8ec19a4f3b3","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:59.011556Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:90373c27e06a2b5356108fcbec339354f66a99a3bc60e04f14bdfac464372e43","observation_id":"b1f5d9e1-5f8e-437e-b61a-8ff6e097dda6","resolution":{"observed_at":"2026-08-07T15:12:02.345678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.323461Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"6a87535b-efca-404d-a73b-328c43592b9a","year":2022},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:59.110112Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:004668d251cd9ce6f0f04c2fafb50c6d650964823ffc9f3fa0d24efb1819ff53","observation_id":"1fe10073-079a-4996-b57d-7c858aaaf69b","resolution":{"observed_at":"2026-08-07T15:12:02.328998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.307443Z","title":"Task-specific skill localization in fine-tuned language models","venue":null,"work_id":"043b6f7c-5b65-4d30-af48-f92dd47d28fc","year":2023},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:59.164320Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:f289a411bb726f916b814b13afd9dcca27d085824a0e890518a011bcd760a8d7","observation_id":"0e1be8a5-bc2b-419d-886e-55c39f5f529b","resolution":{"observed_at":"2026-08-07T15:12:02.312987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.288607Z","title":"When do prompting and prefix-tuning work? a theory of capabilities and limitations","venue":null,"work_id":"1e0bfd3b-5a2f-4ac7-8b3c-eaba34ab48c2","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:59.264580Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:7dff1b1ad0f51853c00d1eca339f8ab360215c0e38b890124cbcd81a4cacb2d1","observation_id":"9870608e-4c31-46cd-87f6-429a3e0f26ef","resolution":{"observed_at":"2026-08-07T15:12:02.295203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.271600Z","title":"Fine-tuning enhances existing mechanisms: A case study on entity tracking","venue":null,"work_id":"1a2634ce-d5af-457e-bbc9-5593b27e8605","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:59.300465Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:d1d2e58d683f8cb65ca100d8da6ac44bcfaf7d75323db9000b914a5198f69457","observation_id":"aabb615d-e817-4643-926d-1a14022edaf1","resolution":{"observed_at":"2026-08-07T15:12:02.277195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.255575Z","title":"Neurons in large language models: Dead, n-gram, positional","venue":null,"work_id":"e030e440-eb9b-4da2-8b4a-6860c4206b99","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:59.456617Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:60f686e618d21025d08f67ef9c4f38772b0d2aa409c087598306ce310b840b91","observation_id":"e585837d-00c9-4ff6-8a29-67d978c42918","resolution":{"observed_at":"2026-08-07T15:12:02.261278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.164287Z","title":"Finding skill neurons in pre-trained transformer-based language models","venue":null,"work_id":"825c574b-e7a8-49b3-852b-aaf3dacb4959","year":2022},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:59.562972Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:fe31702eb8b6f9896dc4800fed07963a9007a28ee78010a7aad18023d8ef1a05","observation_id":"bb789b86-5448-4e13-9ad5-83fd90a7f718","resolution":{"observed_at":"2026-08-07T15:12:02.225231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:02.009683Z","title":"Super-NaturalInstructions: Generalization via declarative instructions on 1600+ NLP tasks","venue":null,"work_id":"da386b80-bac0-4b66-81c1-92affe92bfc5","year":2022},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:11:59.843891Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:3485c1ff4bd6d1effb77356aa31814261d27515a003112ddc172c7e17c3b2a90","observation_id":"1ee714e2-6c90-4c38-9405-4de4a732c500","resolution":{"observed_at":"2026-08-07T15:12:02.088541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T15:12:00.106658Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:00.106658Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:874ca1f467b1db8df61db0cd30bcc7b49b85281482667b6fe3b982e15f0344ce","observation_id":"af953b96-c6e4-4fb9-a0a5-38bd1f900ba8","resolution":{"observed_at":"2026-08-07T15:12:00.106658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:01.849096Z","title":"Knowledge circuits in pretrained transformers","venue":null,"work_id":"97f6785f-f1d1-4788-bf25-68a489bde6e9","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:00.225100Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:763319fe5bee442a4913514200014c11864160b7fefa4fe1d9525634d4fe753e","observation_id":"90f0e5b7-c7bd-460d-8905-ab3020ec4f4a","resolution":{"observed_at":"2026-08-07T15:12:01.921457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:01.724950Z","title":"Towards best practices of activation patching in language models: Metrics and methods","venue":null,"work_id":"adf0a247-38d4-4599-949d-7e5dd204cfad","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:00.343718Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:f9691eed8b1a6a9f3636df8f0c186a145d637de7c6a8e0f00a594e004a0a6dcd","observation_id":"e6d827a9-bbaa-47a2-beb1-ddb678f13b58","resolution":{"observed_at":"2026-08-07T15:12:01.782256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:01.547544Z","title":"How do large language models handle multilingualism? In Advances in Neural Information Processing Systems, 2024","venue":null,"work_id":"0a005f2a-305b-4046-80a5-211716829b08","year":2024},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:00.357834Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:926ce6430a2e53ecec2f07ba1168d7562566d648a2613689e6b85e2ae28d7224","observation_id":"c32fb028-0170-4ef5-94c5-4b4add4ab808","resolution":{"observed_at":"2026-08-07T15:12:01.686449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3100.0098","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:00.776354Z","title":"(b) Overlapping Ratio vs","venue":null,"work_id":"98d748cf-107e-49ca-94b1-1e6dc5963658","year":2023},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:00.428467Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:4b3d1898ed13809354363eda2bbffbc18f0172572961c70ed6f459d47d69f2a4","observation_id":"5612ee6c-37a7-423d-a832-82276e6275da","resolution":{"observed_at":"2026-08-07T15:12:00.838220Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:00.978496Z","title":"He benefited from the world-class education and research facilities at Andrew Jackson University","venue":null,"work_id":"f82c6b4b-d6c8-4b7f-8405-4ad3d3bfdd0c","year":null},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:00.573379Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:6efc9067e09c269e5d872a4c5b33b1eb76d28e8231de2246271f2a49bd9cdd87","observation_id":"d2c135a1-8043-40b7-baa0-4589f0f8e668","resolution":{"observed_at":"2026-08-07T15:12:01.182317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:12:01.292542Z","title":"He benefited from the world-class education and research facilities at Andrew Jackson University","venue":null,"work_id":"5541fd05-4e37-4d4e-b6b3-6bd9b1f9023d","year":null},"citing_paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge","version":2},"reference_index":1982,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:00.484257Z"},"links":{"citing_paper":"/paper/2505.16178"},"observation_digest":"sha256:b9e958f062a093eda33b7f90556f52a1a29fb5e8e142a5b1611f00f1aeeecb4a","observation_id":"f8f2214e-c568-46ed-bedc-a491e28c43e7","resolution":{"observed_at":"2026-08-07T15:12:01.362715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.16178","last_updated":"2026-05-28T04:40:07Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T21:15:05.816569Z","submitted_at":"2025-05-22T03:34:29Z","title":"Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":44},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 3 inbound Pith citation observations for arXiv:2505.16178."}