{"as_of":"2026-08-17T02:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f943b2d39a1602d742d31b2a533946b238bfe22393f0765bc1bf5d3474e22c35","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:37:36.423808Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T04:52:44.489356Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T11:06:17.562742Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"cited_work":{"arxiv_id":"2504.12459","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.12459","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tomas Mikolov, Wen-tau Yih, and Geoffrey Zweig","venue":null,"work_id":"e65f7b68-4d11-4131-af13-dee69dfd45b3","year":null},"citing_paper":{"arxiv_id":"2510.01685","last_updated":"2026-05-08T16:56:36Z","snapshot_observed_at":"2026-08-15T05:20:42.458681Z","submitted_at":"2025-10-02T05:21:34Z","title":"How Do Language Models Compose Functions?","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T11:04:09.179536Z"},"links":{"cited_paper":"/paper/2504.12459","citing_paper":"/paper/2510.01685"},"observation_digest":"sha256:d2327fd94d29c91dbba55aaaaac1a3624a2f3f20f5e8c30f1bb53064b07c478d","observation_id":"eb9371a3-71e5-430c-a26b-c3960bc65be3","resolution":{"observed_at":"2026-05-18T11:06:17.566205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"cited_work":{"arxiv_id":"2504.12459","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.12459","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tomas Mikolov, Wen-tau Yih, and Geoffrey Zweig","venue":null,"work_id":"e65f7b68-4d11-4131-af13-dee69dfd45b3","year":null},"citing_paper":{"arxiv_id":"2605.12412","last_updated":"2026-05-12T17:09:41Z","snapshot_observed_at":"2026-08-11T04:19:07.969715Z","submitted_at":"2026-05-12T17:09:41Z","title":"Stories in Space: In-Context Learning Trajectories in Conceptual Belief Space","version":1},"reference_index":150,"source":"arxiv_source","source_observed_at":"2026-05-13T05:17:34.283917Z"},"links":{"cited_paper":"/paper/2504.12459","citing_paper":"/paper/2605.12412"},"observation_digest":"sha256:814b37fa07fb6a90da2345eec44f9feaae4998cccc071e376231a0f7397e323f","observation_id":"b4298fba-acae-4c14-886a-9dc5eb2345b5","resolution":{"observed_at":"2026-05-13T05:27:19.242265Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12459","snapshot_observed_at":"2026-08-02T04:52:44.489356Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13568","last_updated":"2026-07-15T08:06:59Z","snapshot_observed_at":"2026-08-14T11:04:34.183607Z","submitted_at":"2026-07-15T08:06:59Z","title":"Graded Entity-Familiarity Readouts in Language Models: Polish Adaptation, Cross-Language Robustness, and Refusal Steering","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-02T04:52:44.489356Z"},"links":{"cited_paper":"/paper/2504.12459","citing_paper":"/paper/2607.13568"},"observation_digest":"sha256:a0c1cc3094e103afc3c47299118fd03b5a40c65e642397b1b6bdd2759c35fd41","observation_id":"72086d85-fd50-4d02-ae8f-6cd0aac35639","resolution":{"observed_at":"2026-08-02T04:52:44.489356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12459","snapshot_observed_at":"2026-08-01T03:02:05.090555Z","title":"and Wiegreffe, Sarah and Elazar, Yanai , month = apr, year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25271","last_updated":"2026-07-28T04:18:49Z","snapshot_observed_at":"2026-08-13T02:12:02.677620Z","submitted_at":"2026-07-28T04:18:49Z","title":"Bridging Compute- and Data-Optimal Pretraining","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-01T03:02:05.090555Z"},"links":{"cited_paper":"/paper/2504.12459","citing_paper":"/paper/2607.25271"},"observation_digest":"sha256:3bc92fef5c9ec1cd30c0fdb8043f9cb68b55594f38d8338cff0db0cb416176dd","observation_id":"e530c710-5451-478f-b005-66aa643c563f","resolution":{"observed_at":"2026-08-01T03:02:05.090555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.12459/citation-record","integrity":"/paper/2504.12459/integrity","json":"/paper/2504.12459/citation-record.json","paper":"/paper/2504.12459"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:37.113021Z","title":"To code or not to code? exploring impact of code in pre-training","venue":null,"work_id":"61d0bc96-df83-4483-871d-ef6a26048ff7","year":2025},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.219091Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:cea231750bb19a2717d08dd468400e15a67a6c585881b53171fab0a440f84a6a","observation_id":"9be8aa00-ec8e-4c84-a732-a1276b6a6208","resolution":{"observed_at":"2026-08-16T12:37:37.117127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.222599Z","title":"Hacking smart machines with smarter ones: How to extract meaningful data from machine learning classifiers","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.222599Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:0539d1dbdcdb78d9df14a5af284106f9e96ebf5f4da22984a0d7785aec1a9f59","observation_id":"02a38762-7b87-431e-b172-30f41c838d6e","resolution":{"observed_at":"2026-08-16T12:37:36.222599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12312","last_updated":"2022-11-22T15:03:48Z","snapshot_observed_at":"2026-08-16T16:14:10.448283Z","submitted_at":"2022-11-22T15:03:48Z","title":"Interpreting Neural Networks through the Polytope Lens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12312","snapshot_observed_at":"2026-08-16T12:37:36.225333Z","title":"Interpreting neural networks through the polytope lens, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.225333Z"},"links":{"cited_paper":"/paper/2211.12312","citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:71981791cf09aa881a65d176d68277f63f78d1c0fddd60c02d2fa6ce0beb2dd6","observation_id":"724aa831-5196-4c4f-aeb0-9e158903b4bb","resolution":{"observed_at":"2026-08-16T12:37:36.225333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/9833649","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.728948Z","title":"Membership inference attacks from first principles","venue":null,"work_id":"bfd57aaa-fe61-4d5a-8561-307dce6509b4","year":2022},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.229182Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:4908fdc51f0f0e3a0fe470c0fdb383dbf6f0481ebbb5f160656e03ae78ce20b7","observation_id":"65ade467-bb03-444d-a049-8e60da7558cc","resolution":{"observed_at":"2026-08-16T12:37:36.734597Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.232547Z","title":"Quantifying memorization across neural language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.232547Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:64dba1183e9f931038d00a2f285a32f88abc7452d0fbc86c2cff03a8bdb4d85f","observation_id":"690dd01c-c5c6-44ff-bf86-1a0bb0f9daa4","resolution":{"observed_at":"2026-08-16T12:37:36.232547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:37.093251Z","title":"How do large language models acquire factual knowledge during pretraining? In The Thirty-eighth Annual Conference on Neural Information Processing Systems, 2024","venue":null,"work_id":"09f7bce2-bcf5-4eba-a519-90784decb359","year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.235649Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:fad0a550fc8fc9262a780f5768f4a010f65191b35f746e02a8bd79e18e52f8bd","observation_id":"abe70b6b-8a87-4ac0-9423-9ec506a8e51b","resolution":{"observed_at":"2026-08-16T12:37:37.098171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.239229Z","title":"Identifying Linear Relational Concepts in Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.239229Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:2ba9c9283e9e620b29d23119ee9b5287a4f9a37a79b218a72ff074f53588a502","observation_id":"82581bb6-349b-49d6-9b5a-b1a531e61b08","resolution":{"observed_at":"2026-08-16T12:37:36.239229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.bl","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.567867Z","title":"Recurrent neural networks learn to store and generate sequences using non-linear representations","venue":null,"work_id":"7d88914f-9952-43c7-b3b2-2975237a9627","year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.242809Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:811d8b49264081d599f96bcf262e1d66c184fdaf316496da32b263da4454a542","observation_id":"5d208efe-cb70-4887-a0ca-c1b5a09a3ad8","resolution":{"observed_at":"2026-08-16T12:37:36.572317Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.245789Z","title":"Amnesic Probing: Behavioral Explanation with Amnesic Counterfactuals","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.245789Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:e6696357f9d0849ed18b074b610eb4776d388ff8a163157eae777964436889d9","observation_id":"296226ad-19b5-4b10-944c-4f34e5d2946c","resolution":{"observed_at":"2026-08-16T12:37:36.245789Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.14251","last_updated":"2023-03-24T07:18:59Z","snapshot_observed_at":"2026-08-16T16:42:38.277973Z","submitted_at":"2022-07-28T17:36:24Z","title":"Measuring Causal Effects of Data Statistics on Language Model's `Factual' Predictions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.14251","snapshot_observed_at":"2026-08-16T12:37:36.248759Z","title":"Measuring causal effects of data statistics on language model's `factual' predictions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.248759Z"},"links":{"cited_paper":"/paper/2207.14251","citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:20a1556beffa8276f472d9323b60fa9b2c2bdfae674ca69484338d85bcf4755e","observation_id":"c29e93ab-2b3d-42e3-9d62-b4b8eb55e9a7","resolution":{"observed_at":"2026-08-16T12:37:36.248759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:37.081455Z","title":"Smith, and Jesse Dodge","venue":null,"work_id":"d62b7ca7-c2d4-4354-80dd-9d438e19852a","year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.251685Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:bf11e1089e480185e3d89673424ed38553ee704df08e0f16a3f97abccff624c1","observation_id":"dff16e97-9766-4084-9ddf-47eae3b4dde7","resolution":{"observed_at":"2026-08-16T12:37:37.085232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.255407Z","title":"A mathematical framework for transformer circuits","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.255407Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:e200641e6768453cd2be5ffdccf41ff4b89f7095fef8f67690e9754018bfab69","observation_id":"2128fed1-42a8-4911-864c-38476d366370","resolution":{"observed_at":"2026-08-16T12:37:36.255407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:37.063004Z","title":"T - RE x: A large scale alignment of natural language with knowledge base triples","venue":null,"work_id":"96882c00-063a-4dbc-bf5e-df84d80c9f4b","year":2018},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.258400Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:19291f73a729249362825a5f06750d048bfd0c1deb61c89758698993859da699","observation_id":"f9573e36-13d2-474b-9126-440c4b4dfe71","resolution":{"observed_at":"2026-08-16T12:37:37.067881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.261244Z","title":"Towards Understanding Linear Word Analogies","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.261244Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:42e9936b2d870e9d32f9d66063cb518f17285ca70f232c16a2cfe8e8391292e5","observation_id":"b27cfc5b-8070-4529-8f6b-b4934ec0c0ac","resolution":{"observed_at":"2026-08-16T12:37:36.261244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-16T12:37:36.264651Z","title":"The pile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.264651Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:71f7a32913527bea6248dad9d6808a2eacbd83b0ce47923e89ee18e6f9560fb2","observation_id":"ec363ae7-6085-4fd0-8ed9-1d9c0af324bc","resolution":{"observed_at":"2026-08-16T12:37:36.264651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.268775Z","title":"Scaling and evaluating sparse autoencoders","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.268775Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:2809d60ae1e85cb5c172d1c2bdf0fc01eee23ca8680310b183eb5cb92ddbaef1","observation_id":"16ecfce0-7101-4a7e-b91e-ef1b3bd77a7f","resolution":{"observed_at":"2026-08-16T12:37:36.268775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:37.044683Z","title":"What can transformers learn in-context? a case study of simple function classes","venue":null,"work_id":"ad99ff50-b4ab-45fa-8c03-74f71b95d637","year":2022},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.272216Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:2a2d0e502e3f9818212150eeec7c857b8f63e2b980a431ebd2fadb399e299495","observation_id":"dacfa710-47cd-4a08-a7fc-71c7dafc86e4","resolution":{"observed_at":"2026-08-16T12:37:37.048571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.276369Z","title":"Analogy-based detection of morphological and semantic relations with word embeddings: what works and what doesn`t","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.276369Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:b71aefb05c39aea10b73e0fc4875a29fc2a8ae250436e31586ac3a14da729899","observation_id":"8011d74e-f40c-4da3-a142-ecbac4602b57","resolution":{"observed_at":"2026-08-16T12:37:36.276369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.280450Z","title":"OLM o: Accelerating the science of language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.280450Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:9b55b4f7cc406030832ab783bc6f42269004cd13c366fafbd2dc418da17fa5be","observation_id":"0f6d728a-31b0-4b19-b183-0614e70e8c81","resolution":{"observed_at":"2026-08-16T12:37:36.280450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:37.032836Z","title":null,"venue":null,"work_id":"671c1cd0-8c39-43bc-8cc4-07e68afb08f6","year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.284194Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:15bff67e1ff0221ceef2e59c9b1c28969b1046e8a71b72fd4cd9ba256cdf9fa3","observation_id":"61de6d86-90cd-4feb-8723-69a9970c8ba9","resolution":{"observed_at":"2026-08-16T12:37:37.036827Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.287788Z","title":"In- Context Learning Creates Task Vectors","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.287788Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:c56df1dca98623865fbb91b6b055f4d3ea093eb4bd033b4c057f2da1c099238f","observation_id":"fc1f87f2-39a9-495b-94b9-fdc8f5cd209b","resolution":{"observed_at":"2026-08-16T12:37:36.287788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.292061Z","title":"Linearity of relation decoding in transformer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.292061Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:9f75c7514e4bf0f0a32b86afae9e9f747b84c4d6fb98576cae2fabac91a48d0a","observation_id":"935a2fb3-0694-45eb-8236-cd6caac42e6d","resolution":{"observed_at":"2026-08-16T12:37:36.292061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.294958Z","title":"Sparse autoencoders find highly interpretable features in language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.294958Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:783b63b2f6545e496fec681f858e2e71b6a2dbbac5b9279a580767ad778b7dbc","observation_id":"ef2593e1-8db3-4dca-af3f-113b8d36f760","resolution":{"observed_at":"2026-08-16T12:37:36.294958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:37.005203Z","title":"On the origins of linear representations in large language models","venue":null,"work_id":"520412c8-e187-4333-97d7-e745f6527a9d","year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.297826Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:820bcb53621b1056719b440a3b8469417f1dd5608bef134216f4e0c205b0867f","observation_id":"1820c1dd-5bb4-4953-ad68-da5d79e0ca4a","resolution":{"observed_at":"2026-08-16T12:37:37.010624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/w18-2905","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.524673Z","title":null,"venue":null,"work_id":"1aba2e91-481a-4c77-813e-83dec4f7037c","year":2018},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.300566Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:a3cdeddc26dd253e69f883d0d0c9d9998cc428cb0d57ec06435f76ca41717c31","observation_id":"28864f5b-e906-4a6e-9f25-80469d09aa74","resolution":{"observed_at":"2026-08-16T12:37:36.528778Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.992811Z","title":"Multilingual reliability and semantic structure of continuous word spaces","venue":null,"work_id":"00a4303b-4ef2-48fc-b5af-660312b3ec83","year":2015},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.303582Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:e392f79227d41af6b43331d1c7306af1d8fda65b45c366e2a87d8867c709b279","observation_id":"63c8a6f8-3f32-4c64-969c-15cb5e33744f","resolution":{"observed_at":"2026-08-16T12:37:36.996973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.307341Z","title":"A pretrainer`s guide to training data: Measuring the effects of data age, domain coverage, quality, & toxicity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.307341Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:b8731b6109d328d9196b755831933c16a2dd188514ebf44cc98443f7807b98f5","observation_id":"9646f0d9-ee4c-458e-8ced-9bf0aaa0b3ba","resolution":{"observed_at":"2026-08-16T12:37:36.307341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.314919Z","title":"At which training stage does code data help LLM s reasoning? In The Twelfth International Conference on Learning Representations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.314919Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:545f1b486b382ba064c76c0e607111cf0fc8badf705800f92f06955feb1c4b93","observation_id":"80ebb938-d5d8-4a12-b775-374d0ec56c21","resolution":{"observed_at":"2026-08-16T12:37:36.314919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.317695Z","title":"When not to trust language models: Investigating effectiveness of parametric and non-parametric memories","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.317695Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:4dbe57967811ca7d88fd015e31b44c796bef63b861ee19982588838cc413f6b5","observation_id":"e08f2e27-05eb-4b4c-b93d-b3ca2e19131e","resolution":{"observed_at":"2026-08-16T12:37:36.317695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.320670Z","title":"Embers of autoregression show how large language models are shaped by the problem they are trained to solve","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.320670Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:a1f16f770a743665264138eaca84629f98e9bddced424efbeeac8a9bd5d0f6c8","observation_id":"5148ca2b-7301-431a-9bb8-06e8e79eb9c3","resolution":{"observed_at":"2026-08-16T12:37:36.320670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.323521Z","title":"Language models implement simple W ord2 V ec-style vector arithmetic","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.323521Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:1539f9d202ae46d0d95dae85ac876a28e666ff51443afd7dab9e281845abfad1","observation_id":"7276c5e4-7105-4cd2-a26b-dbe878ecf07d","resolution":{"observed_at":"2026-08-16T12:37:36.323521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1301.3781","last_updated":"2013-09-07T00:30:40Z","snapshot_observed_at":"2026-07-06T03:04:11.148340Z","submitted_at":"2013-01-16T18:24:43Z","title":"Efficient Estimation of Word Representations in Vector Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1301.3781","snapshot_observed_at":"2026-08-16T12:37:36.326920Z","title":"Efficient estimation of word representations in vector space","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.326920Z"},"links":{"cited_paper":"/paper/1301.3781","citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:fd7b327fb39c40637ed13d75d56cffae3840db7e39eff7b931fa4da25e975e9b","observation_id":"07fb214a-a2e4-4e3b-9bf2-a3ce395845e2","resolution":{"observed_at":"2026-08-16T12:37:36.326920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.967232Z","title":"Distributed representations of words and phrases and their compositionality","venue":null,"work_id":"bf269bf4-ce55-49b6-807c-f83144588da2","year":2013},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.330488Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:dfa09a8da1c4bfdd99eee7091c452100a111d259cff6ec8e419708d118239804","observation_id":"d423fe4a-a934-4b57-b535-2dd7941ac934","resolution":{"observed_at":"2026-08-16T12:37:36.970610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.333747Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.333747Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:5f9cd411c5b8bf83aa231e0b95c3134ffe471416165c3489652a672a783c0aa9","observation_id":"c8898bc0-9f6a-4d58-8c0b-a8504aaba89c","resolution":{"observed_at":"2026-08-16T12:37:36.333747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.955276Z","title":"Zoom in: An introduction to circuits","venue":null,"work_id":"1c266413-9faa-486a-b698-a04295568eb1","year":2020},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.336933Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:ca3350a207159562a707f8b7c0bfe60ff5ca9972b447e7892e00e7d77312c650","observation_id":"002554d9-8b63-4da5-9dec-f759a6602b8c","resolution":{"observed_at":"2026-08-16T12:37:36.959877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.341261Z","title":"Chatterji, Faisal Ladhak, and Tatsunori Hashimoto","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.341261Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:0a24d730d6ba1943ea189a026a8ef25a72598f7ed38aead0355dd13c0f41a5fa","observation_id":"f021bf14-4dde-4a74-9088-6eb57540e730","resolution":{"observed_at":"2026-08-16T12:37:36.341261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.937271Z","title":"Learning Hierarchical Structures with Linear Relational Embedding","venue":null,"work_id":"c946ea07-9276-4097-9394-9048d1881849","year":2001},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.344829Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:4e04e7585f02c7ca1b0a7f60296966ec17bf745b36de7116bc463b8cb46254ac","observation_id":"c529b3bc-2e8f-452b-bdf4-4a5c14891550","resolution":{"observed_at":"2026-08-16T12:37:36.940678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.925269Z","title":"The Linear Representation Hypothesis and the Geometry of Large Language Models","venue":null,"work_id":"bdd932c9-40b4-4602-9496-7ac1969c9c32","year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.349063Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:0e59cc4c30bd5536c66d09cbaf27b3f191ac8f46012425d73151b2078ff6649c","observation_id":"059f7a5b-ed0e-4560-abea-b6611f4a5ae9","resolution":{"observed_at":"2026-08-16T12:37:36.929566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.352815Z","title":"G lo V e: Global vectors for word representation","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.352815Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:bf9998f58548b2a921cf868cf8d52257ac4d956cc9b0a597d79fa1ed4f74d240","observation_id":"78bf24e7-b5fc-47f4-98f7-6dbc93b669ab","resolution":{"observed_at":"2026-08-16T12:37:36.352815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.913312Z","title":"Null it out: Guarding protected attributes by iterative nullspace projection","venue":null,"work_id":"dc757c21-385c-406a-b348-87d535f61cd9","year":2020},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.356294Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:3cbbd1d098cc19c2f8c8a282b6ca324e0b4061afe519c8d82935c38d192222b9","observation_id":"e8e3a177-e391-4a5d-b57d-a290d40dad70","resolution":{"observed_at":"2026-08-16T12:37:36.917292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.359724Z","title":"Impact of pretraining term frequencies on few-shot numerical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.359724Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:55b370ee69bbb4d1c2e756500cee8b2247ff2a968b2ee75fc56b12466e7cf83d","observation_id":"a78393f9-dd28-4252-89bc-4b33ca76a95d","resolution":{"observed_at":"2026-08-16T12:37:36.359724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.901516Z","title":"Backtracking mathematical reasoning of language models to the pretraining data","venue":null,"work_id":"2dfa0d13-16db-4fdb-a2ec-d41069a44cfb","year":2023},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.362674Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:d8207611255957614ca5603bcfabc0e8728ab738f24c4b30bababb5495976fcf","observation_id":"77363836-c1b2-4098-b3eb-386f16046404","resolution":{"observed_at":"2026-08-16T12:37:36.905434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.365962Z","title":"Steering llama 2 via contrastive activation addition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.365962Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:9df81bbd4a4b03649d15b391417ea72688a7120c4b445086bd095ba986f5cd3e","observation_id":"439fd0fe-b768-4db5-8271-0a4eea112db9","resolution":{"observed_at":"2026-08-16T12:37:36.365962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.369689Z","title":"Salton, A","venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.369689Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:2591a53a238b6078f0c4a699c348f7c18042d80b0e7204c4fa8d483a6ac06156","observation_id":"f2046014-23a3-4e24-a48e-82f066f28c8c","resolution":{"observed_at":"2026-08-16T12:37:36.369689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.372202Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.372202Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:794bf096bc14b34df373aa8ee8e3cf852710b4c1e1563263b4b9d7cfeac2cc60","observation_id":"dd67bddf-8ca1-4c1e-b87e-44f74ebb32a4","resolution":{"observed_at":"2026-08-16T12:37:36.372202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.375367Z","title":"The bias amplification paradox in text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.375367Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:91d39d64d21fc3c988446904d113d17b680526a9b1b80656e48b6b3a61fdaa66","observation_id":"3f630405-b32b-49dd-a1de-c818931f275e","resolution":{"observed_at":"2026-08-16T12:37:36.375367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.378430Z","title":"Detecting pretraining data from large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.378430Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:f33b98afd4bb36dfd570c1cb94760850a2820a60d20557374f94bbbe02763dd1","observation_id":"f37685d7-e8c3-4065-99d2-e447deaff3da","resolution":{"observed_at":"2026-08-16T12:37:36.378430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.381493Z","title":"Membership inference attacks against machine learning models","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.381493Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:0b79b3d8457f1cf8e9eabc3a746f612ea851b5aa5001d3c93ed21a6ec36fd104","observation_id":"707bccd1-206e-49a4-ad5f-103f29e67cc9","resolution":{"observed_at":"2026-08-16T12:37:36.381493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.385139Z","title":"The curious case of hallucinatory (un)answerability: Finding truths in the hidden states of over-confident large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.385139Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:db48c9999c89874f249674e4b4edb37cccbc46dee5cbf08252f8eca27270d23f","observation_id":"8bdb9137-e7d0-4ed3-b297-acb6ea1f6d2a","resolution":{"observed_at":"2026-08-16T12:37:36.385139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.388267Z","title":"Dolma: an open corpus of three trillion tokens for language model pretraining research","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.388267Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:645b50b85603251ec03f4f230012157811ebb5e3261f21cae3319ba874ed2cf0","observation_id":"87c6a1e0-ac1d-4729-875f-966a3e12ef57","resolution":{"observed_at":"2026-08-16T12:37:36.388267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.390855Z","title":"Extracting Latent Steering Vectors from Pretrained Language Models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.390855Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:d08946f370629e7f5f93d2dbde5a0388c7bef9f42943b0d1ce8b4aaa0e8be46a","observation_id":"c8182546-7004-4d5e-b677-b7a59e917a92","resolution":{"observed_at":"2026-08-16T12:37:36.390855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.06024","last_updated":"2022-07-05T13:54:26Z","snapshot_observed_at":"2026-08-16T18:40:22.907188Z","submitted_at":"2021-09-13T14:54:39Z","title":"Formalizing and Estimating Distribution Inference Risks","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.06024","snapshot_observed_at":"2026-08-16T12:37:36.393954Z","title":"Formalizing and estimating distribution inference risks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.393954Z"},"links":{"cited_paper":"/paper/2109.06024","citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:638143a7de4c4d4beca276b72732f0ba9c48ae7ecf8b13cb4055d9a7c2a94b78","observation_id":"3bf08ac5-ee0c-47ea-af86-ba018a230d97","resolution":{"observed_at":"2026-08-16T12:37:36.393954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.877497Z","title":"Scaling Monosemanticity : Extracting Interpretable Features from Claude 3 Sonnet","venue":null,"work_id":"498104b4-2c39-48fe-bea2-ce60c1b05f38","year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.397117Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:8784b2cd92960a2ad63408525d48a9d857c9b53fe4bb5fa2019738979e97ab3a","observation_id":"ab1dba8d-4911-47ac-b555-1fe3ce592346","resolution":{"observed_at":"2026-08-16T12:37:36.880815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.399886Z","title":"Function vectors in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.399886Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:4691225693d06ceda1cb9d8c23f0c8831c4be4e03fa704f963a90cb80765f1c6","observation_id":"c10e049a-c1a9-429b-a62f-f7d6d78e05fd","resolution":{"observed_at":"2026-08-16T12:37:36.399886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.402311Z","title":"GPT-J-6B: A 6 Billion Parameter Autoregressive Language Model","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.402311Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:8960ad67e6a4a2a90a67990a7163707b7100ef1dffa8e9456b22a88190720129","observation_id":"980dfd8b-4b2f-4b44-866e-321f219ce919","resolution":{"observed_at":"2026-08-16T12:37:36.402311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.850325Z","title":"Understanding reasoning ability of language models from the perspective of reasoning paths aggregation","venue":null,"work_id":"ea93f0b1-5db2-467a-b187-790c99fe20c9","year":2024},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.405447Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:f53bdf6fd9b52f69217427d6ec9e4a0c8948092b63461185e53e232becefac1a","observation_id":"2d105eac-e5ca-42f4-b4de-233b54968e97","resolution":{"observed_at":"2026-08-16T12:37:36.855643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.408579Z","title":"Generalization v.s","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.408579Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:a8e32715922369a941c19c2b03f931a86f522da2c30789eef1052e4adcf7091e","observation_id":"a2631398-a306-4511-9fc1-44dc66fb242d","resolution":{"observed_at":"2026-08-16T12:37:36.408579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.411183Z","title":"Doremi: Optimizing data mixtures speeds up language model pretraining","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.411183Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:470edd60b883398872d6f59f0740b5091f835a3559168a08480b1f0037230631","observation_id":"2f03f27a-ce68-4dbd-8a02-dd110def5698","resolution":{"observed_at":"2026-08-16T12:37:36.411183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.413796Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.413796Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:0abc478eb872b7cb02e577391e11c82a44896120d97d408887775c4c24d54c6d","observation_id":"c1b8bedb-0c0b-4e4e-aca8-801ac0042f62","resolution":{"observed_at":"2026-08-16T12:37:36.413796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.417232Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.417232Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:2240642fe9b1f79c3e9854696668fc5f004f4165f1356e4ea10fe0fd9e68d6a5","observation_id":"10cc502b-2936-448a-a369-1dcf261fe555","resolution":{"observed_at":"2026-08-16T12:37:36.417232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.420669Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.420669Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:4a548a6404be177369b34d18cba021f4520380c60209e7cfe9408a7c8f0efe1b","observation_id":"9f53c3e7-0937-4ab4-9c36-cbe7f4006e84","resolution":{"observed_at":"2026-08-16T12:37:36.420669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:36.423808Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-16T12:37:36.423808Z"},"links":{"citing_paper":"/paper/2504.12459"},"observation_digest":"sha256:f0a6ed9518d9497be8231c7a2c78b24e554907351e8f972d639cd7d44c940633","observation_id":"4fd38eb4-93c0-4589-96fe-51cfee1bf51e","resolution":{"observed_at":"2026-08-16T12:37:36.423808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.12459","last_updated":"2025-04-16T19:50:03Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T00:43:24.016462Z","submitted_at":"2025-04-16T19:50:03Z","title":"On Linear Representations and Pretraining Data Frequency in Language Models"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":3,"verified_fuzzy":15},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 4 inbound Pith citation observations for arXiv:2504.12459."}