{"as_of":"2026-08-20T08:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e7235573abf971adba8293a854e64dd2b7b3c0393d74d319d5540d61c7b8cc3a","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T13:58:53.311191Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:00:37.098270Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T23:42:16.124037Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"cited_work":{"arxiv_id":"1908.04211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1908.04211","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"36847e35-295c-43e5-a348-50dcb57a2c3c","year":2020},"citing_paper":{"arxiv_id":"2012.06678","last_updated":"2020-12-11T23:31:23Z","snapshot_observed_at":"2026-08-14T12:45:55.154777Z","submitted_at":"2020-12-11T23:31:23Z","title":"TabTransformer: Tabular Data Modeling Using Contextual Embeddings","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-16T21:32:31.241434Z"},"links":{"cited_paper":"/paper/1908.04211","citing_paper":"/paper/2012.06678"},"observation_digest":"sha256:61c68e4a12f803e6d464aff685b3a6d4624a1f53318bf952424fd76cb1f76bd0","observation_id":"175b10e9-8a08-4553-8fdc-777b0e4bd12a","resolution":{"observed_at":"2026-05-16T21:32:31.296446Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"cited_work":{"arxiv_id":"1908.04211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1908.04211","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"36847e35-295c-43e5-a348-50dcb57a2c3c","year":2020},"citing_paper":{"arxiv_id":"2503.16771","last_updated":"2026-04-12T13:23:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T01:00:45Z","title":"Enabling Global, Human-Centered Explanations for LLMs:From Tokens to Interpretable Code and Test Generation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T23:41:22.017848Z"},"links":{"cited_paper":"/paper/1908.04211","citing_paper":"/paper/2503.16771"},"observation_digest":"sha256:3d8a599ceda777be776a546a78252554fc4726aeab233187017c71ea50594d06","observation_id":"888e2002-2eb8-4f1a-9065-5696c05af852","resolution":{"observed_at":"2026-05-22T23:42:16.127211Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.04211","snapshot_observed_at":"2026-08-15T19:00:37.098270Z","title":"On identifiability in transformers.arXiv preprint arXiv:1908.04211,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.18011","last_updated":"2025-06-22T12:22:56Z","snapshot_observed_at":"2026-08-17T12:49:07.557539Z","submitted_at":"2025-06-22T12:22:56Z","title":"Probing the Embedding Space of Transformers via Minimal Token Perturbations","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T19:00:37.098270Z"},"links":{"cited_paper":"/paper/1908.04211","citing_paper":"/paper/2506.18011"},"observation_digest":"sha256:fc746f8ccefad770767dbf6fc57487ad82737e262a353f6585ec57b66013390c","observation_id":"6080de41-71b7-40f1-87dc-b490649218c7","resolution":{"observed_at":"2026-08-15T19:00:37.098270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.04211","snapshot_observed_at":"2026-08-06T22:22:38.869579Z","title":"and et al","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.21812","last_updated":"2025-06-26T23:25:22Z","snapshot_observed_at":"2026-08-15T15:17:34.279609Z","submitted_at":"2025-06-26T23:25:22Z","title":"Towards Transparent AI: A Survey on Explainable Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:38.869579Z"},"links":{"cited_paper":"/paper/1908.04211","citing_paper":"/paper/2506.21812"},"observation_digest":"sha256:384cc8ba37e1eec73de4eff17dcfe62134bd2f8a31a311fb3cca776ef39a19b5","observation_id":"5bd43240-299f-460b-b5ac-184373dd68f9","resolution":{"observed_at":"2026-08-06T22:22:38.869579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.04211","snapshot_observed_at":"2026-08-06T18:08:20.728496Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.10596","last_updated":"2025-07-12T06:31:38Z","snapshot_observed_at":"2026-08-11T16:52:47.438481Z","submitted_at":"2025-07-12T06:31:38Z","title":"PLEX: Perturbation-free Local Explanations for LLM-Based Text Classification","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:20.728496Z"},"links":{"cited_paper":"/paper/1908.04211","citing_paper":"/paper/2507.10596"},"observation_digest":"sha256:b5a45193758d290755a340ac2272dda4b5769e43fe792f4302b85622bb4c06e5","observation_id":"1554c404-456a-4417-bf34-18971ceceec8","resolution":{"observed_at":"2026-08-06T18:08:20.728496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.04211","snapshot_observed_at":"2026-08-05T21:45:27.642304Z","title":"arXiv preprint arXiv:1908.04211 , year=","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2608.03294","last_updated":"2026-08-07T05:20:15Z","snapshot_observed_at":"2026-08-16T21:41:57.944815Z","submitted_at":"2026-08-04T08:06:15Z","title":"Provably Learning Multi-Head Attention with Queries","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T21:45:27.642304Z"},"links":{"cited_paper":"/paper/1908.04211","citing_paper":"/paper/2608.03294"},"observation_digest":"sha256:b9010cc65da56e6cdbee3c6e8eb7a26f46419e29d5b49406e92054c30017d830","observation_id":"8d1c3292-16c8-45b7-b35b-d0d3fd1a8c07","resolution":{"observed_at":"2026-08-05T21:45:27.642304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.04211","snapshot_observed_at":"2026-08-10T04:35:40.561992Z","title":"arXiv preprint arXiv:1908.04211 , year=","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2608.03294","last_updated":"2026-08-07T05:20:15Z","snapshot_observed_at":"2026-08-16T21:41:57.944815Z","submitted_at":"2026-08-04T08:06:15Z","title":"Provably Learning Multi-Head Attention with Queries","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T04:35:40.561992Z"},"links":{"cited_paper":"/paper/1908.04211","citing_paper":"/paper/2608.03294"},"observation_digest":"sha256:91afd426972a7b461da4bda590bab954f2dcf244cc4fd469737be42c84e20d8e","observation_id":"6fc581b4-b572-4423-82a8-e8121b416603","resolution":{"observed_at":"2026-08-10T04:35:40.561992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1908.04211/citation-record","integrity":"/paper/1908.04211/integrity","json":"/paper/1908.04211/citation-record.json","paper":"/paper/1908.04211"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1901.08634","last_updated":"2019-12-09T17:32:42Z","snapshot_observed_at":"2026-08-17T02:55:13.536186Z","submitted_at":"2019-01-24T20:22:14Z","title":"A BERT Baseline for the Natural Questions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.08634","snapshot_observed_at":"2026-08-14T13:58:53.133516Z","title":"A BERT B aseline for the N atural Q uestions","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.133516Z"},"links":{"cited_paper":"/paper/1901.08634","citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:e2dd9b1053c10e398f9f5510e3b249cd7ee2cbffef8aa39d3fe319b0e0f6e90d","observation_id":"f74aad54-9e40-43cc-ada8-6b5ce92a081f","resolution":{"observed_at":"2026-08-14T13:58:53.133516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.00570","last_updated":"2019-07-08T14:57:07Z","snapshot_observed_at":"2026-08-18T19:26:20.841290Z","submitted_at":"2019-07-01T06:46:43Z","title":"Do Transformer Attention Heads Provide Transparency in Abstractive Summarization?","version":2},"cited_work":{"arxiv_id":"1907.00570","doi":null,"metadata_source":"pith","pith_arxiv_id":"1907.00570","snapshot_observed_at":"2026-08-14T13:58:53.626147Z","title":"Do Transformer Attention Heads Provide Transparency in Abstractive Summarization?","venue":"cs.CL","work_id":"48a8a38f-cb21-4747-a30f-f1004a90902f","year":2019},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.138076Z"},"links":{"cited_paper":"/paper/1907.00570","citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:5458ffbaa2cad4c46ed6bcb15ea4f4eccbb10eaf4c821986765332d1ca873947","observation_id":"cd3a8c9e-17fa-440d-b038-522b43084f5c","resolution":{"observed_at":"2026-08-14T13:58:53.630069Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-08-18T12:17:42.484599Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-08-14T13:58:53.142812Z","title":"Neural machine translation by jointly learning to align and translate","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.142812Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:0e9e054c32935a25738675e93e1b9720ce8c87df0e31270356ba39837afaa0d2","observation_id":"b7bc76cd-955f-41e3-9e61-8f8a0c4bcfcd","resolution":{"observed_at":"2026-08-14T13:58:53.142812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.927719Z","title":"Bellman and Karl Johan str \\\"o m","venue":null,"work_id":"628f55cb-37f0-4a87-846a-10114b585b1b","year":1970},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.146950Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:67d80930cb7e7bc0ce4e7f721883bfcaf5e0172738abb2d3619edda95c7475a4","observation_id":"b0f1f77b-aa15-42b2-abd9-3c69d839bb78","resolution":{"observed_at":"2026-08-14T13:58:53.931375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.917319Z","title":"Brown, Stephen A","venue":null,"work_id":"89e01385-703e-44d9-b9de-4c9ba8b9daee","year":1993},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.150942Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:8bd158c5e734e9ba80d34713839fa0e6ec40e73f659013dc807f67d61a838750","observation_id":"1f8506f2-d3f2-4c2a-9beb-9fdc8f5fc5d1","resolution":{"observed_at":"2026-08-14T13:58:53.920963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04341","last_updated":"2019-06-11T01:31:41Z","snapshot_observed_at":"2026-08-16T14:00:03.452025Z","submitted_at":"2019-06-11T01:31:41Z","title":"What Does BERT Look At? An Analysis of BERT's Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.04341","snapshot_observed_at":"2026-08-14T13:58:53.154824Z","title":null,"venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.154824Z"},"links":{"cited_paper":"/paper/1906.04341","citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:84f0bcecf8e4c6fe52ca2152736fd9910db9595e6a19f7cf8cedb042450d596f","observation_id":"4b0ee127-7aa5-422b-8455-e178b26a6d88","resolution":{"observed_at":"2026-08-14T13:58:53.154824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02715","last_updated":"2019-10-28T17:53:14Z","snapshot_observed_at":"2026-08-18T03:48:48.186861Z","submitted_at":"2019-06-06T17:33:22Z","title":"Visualizing and Measuring the Geometry of BERT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.02715","snapshot_observed_at":"2026-08-14T13:58:53.159141Z","title":"Vi \\' e gas, and Martin Wattenberg","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.159141Z"},"links":{"cited_paper":"/paper/1906.02715","citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:ffa3fe1769456aff8499aa2b4d971fa8126af686e1ef609094a0b9189e7d591a","observation_id":"35acef93-5806-4b1a-9433-ddd044ce590f","resolution":{"observed_at":"2026-08-14T13:58:53.159141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.907584Z","title":"Universal transformers","venue":null,"work_id":"f76f9b34-504d-4c5a-b502-549528af3302","year":2019},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.163309Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:4e01f5a4ee2992cdbaa2e5b5cf53abe5372af5ab85bf84d4eb1e86a96f88b2a5","observation_id":"e41f26ad-837d-4f72-bfef-0b5ca326c92a","resolution":{"observed_at":"2026-08-14T13:58:53.911104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.897423Z","title":"BERT: pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"f7ec4584-bdc1-4d1c-b9b2-5ed60f5bbb84","year":2019},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.166831Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:71a2b727dd17a04a6a4dfb7415ac2e3ceccd7a9ecb4be953220d3916b309deb4","observation_id":"73bc7a39-c9db-487b-9fce-35ab09ce1d16","resolution":{"observed_at":"2026-08-14T13:58:53.901087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.887198Z","title":"Dolan and Chris Brockett","venue":null,"work_id":"2800691b-5f6f-400b-b83f-55f418e2d18c","year":2005},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.170097Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:8f4907142d4ad19232890d9f535ea36b5820f48337dd32aaeeca0d2c91263deb","observation_id":"59a37f41-52bb-4dc6-97ec-4d9f483c3164","resolution":{"observed_at":"2026-08-14T13:58:53.890896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.876017Z","title":"Understanding the difficulty of training deep feedforward neural networks","venue":null,"work_id":"b9ae2f8f-f1e9-4a50-9893-1a766e8d2cf7","year":2010},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.173791Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:288b11fc79af576660c2c435b1380dd78080e0b6bab8cd6197bf75183ecc79c6","observation_id":"94bf0c2b-7380-44db-a562-c2f2e83786ed","resolution":{"observed_at":"2026-08-14T13:58:53.879633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-08-13T19:48:28.322536Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-14T13:58:53.177287Z","title":"Bridging nonlinearities and stochastic regularizers with gaussian error linear units","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.177287Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:a410989fd61788cf3d3c17a44cf52882a546e17f65729d371cd7310f39370bc5","observation_id":"75dee84f-6cb6-47d8-9c08-9a1ccf262815","resolution":{"observed_at":"2026-08-14T13:58:53.177287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.865153Z","title":null,"venue":null,"work_id":"bf67bd55-1c33-4955-9e97-3815bc2ba1cc","year":2019},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.181149Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:4f016b48d777e41a5aefe98ce1d817df7bdee7de8efaea16a9e2694a9a187749","observation_id":"ae400b3d-f2b3-4065-baea-058580f47dff","resolution":{"observed_at":"2026-08-14T13:58:53.868772Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.854427Z","title":null,"venue":null,"work_id":"a45b8c1a-8f10-4d30-ac65-d9f0bd7afd22","year":2019},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.184493Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:1c5d4074f0ecdcde590166350324a6444f3ee128b506515329867ab4b7862f97","observation_id":"1687f85c-0f52-4f23-92df-9cabe680fc84","resolution":{"observed_at":"2026-08-14T13:58:53.858146Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.843284Z","title":"Microsoft translator at wmt 2019: Towards large-scale document-level neural machine translation","venue":null,"work_id":"9e08a996-52e5-4456-b6a8-7602ff3334ab","year":2019},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.187860Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:530ef0117b503c44322dc247a4e2dd98aa2bdd5a4ce7d91c53c2723497ce0857","observation_id":"d346aa0b-67a1-4b1e-b654-5a45d9998ef5","resolution":{"observed_at":"2026-08-14T13:58:53.847358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-14T13:58:53.191205Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.191205Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:5de3eb386b64ab083b2005deb274bcdba67c71bc9610bd00775e1a0279347848","observation_id":"8a29dfe3-6757-43f6-8d38-7acdff17f984","resolution":{"observed_at":"2026-08-14T13:58:53.191205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.832905Z","title":"Attention is (not) all you need for commonsense reasoning","venue":null,"work_id":"b874e0e3-9b21-467d-9f3c-ef7b5bbe4bd6","year":2019},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.194762Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:32e96c99e9259b4ad7b40af6fb547a6dc47322f3e27de9c3ec73992f82ba2d13","observation_id":"eeae91fa-05c7-4f21-a4bf-796d73a722aa","resolution":{"observed_at":"2026-08-14T13:58:53.836629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.198150Z","title":"Albert: A lite bert for self-supervised learning of language representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.198150Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:a542c42412a4e99bc3416769e6c809a889e3e9b3a4a9f70024a7de83e042caac","observation_id":"ec4fd3ad-5e73-4d0a-b51f-78a67866d002","resolution":{"observed_at":"2026-08-14T13:58:53.198150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.01698","last_updated":"2019-06-04T19:41:10Z","snapshot_observed_at":"2026-08-16T15:06:38.246604Z","submitted_at":"2019-06-04T19:41:10Z","title":"Open Sesame: Getting Inside BERT's Linguistic Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.01698","snapshot_observed_at":"2026-08-14T13:58:53.201568Z","title":"Open sesame: Getting inside bert's linguistic knowledge","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.201568Z"},"links":{"cited_paper":"/paper/1906.01698","citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:31d6655c11540008028f06c8d1a125c41d03283afa90339853c3197dfeaab1b0","observation_id":"ce65e208-cac8-497c-a133-7b2d52bdcc5f","resolution":{"observed_at":"2026-08-14T13:58:53.201568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-14T13:58:53.205312Z","title":"Roberta: A robustly optimized bert pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.205312Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:a3650444457805879ed7ffb77b91e403e2b4c7a892970213fc6629599ca465af","observation_id":"d12daa22-ff2d-4e85-9343-03f53a22e7ff","resolution":{"observed_at":"2026-08-14T13:58:53.205312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.815584Z","title":"Extracting syntactic trees from transformer encoder self-attentions","venue":null,"work_id":"9fee590e-770e-41be-a745-61be6a42c8de","year":2018},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.208802Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:72d602d09493a34a5eba77694a9376370aa2b69bbcf8be92d7c6b610e8fd963b","observation_id":"1726a06c-9233-46c6-931a-7b1bd7d16523","resolution":{"observed_at":"2026-08-14T13:58:53.819541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10650","last_updated":"2019-11-04T15:49:01Z","snapshot_observed_at":"2026-08-19T23:34:26.675662Z","submitted_at":"2019-05-25T18:27:28Z","title":"Are Sixteen Heads Really Better than One?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10650","snapshot_observed_at":"2026-08-14T13:58:53.211989Z","title":"Are sixteen heads really better than one? CoRR, abs/1905.10650, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.211989Z"},"links":{"cited_paper":"/paper/1905.10650","citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:ce9bfa9d8338d6352254253e25cab13e0ea8ec8cd4f7f0105fc29d52df66d07e","observation_id":"83a23a39-9870-4c73-8adf-e808b850c159","resolution":{"observed_at":"2026-08-14T13:58:53.211989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.01758","last_updated":"2019-05-05T22:16:08Z","snapshot_observed_at":"2026-08-16T09:42:01.170686Z","submitted_at":"2019-05-05T22:16:08Z","title":"Investigating the Successes and Failures of BERT for Passage Re-Ranking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.01758","snapshot_observed_at":"2026-08-14T13:58:53.215593Z","title":"Bruce Croft","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.215593Z"},"links":{"cited_paper":"/paper/1905.01758","citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:2f08917cd25ddb851e645599e0ebfb05a402b4f78d160d503d472d1e9f865ccc","observation_id":"c9097d92-760f-4672-86f2-a8aa80daf38a","resolution":{"observed_at":"2026-08-14T13:58:53.215593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.805630Z","title":"Peters, Mark Neumann, Luke Zettlemoyer, and Wen - tau Yih","venue":null,"work_id":"9e0f9977-a89f-41bd-8024-915ca28900b7","year":2018},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.219278Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:3f39fbd607de35c09dfecd42148b9b4f613e722eaa4d78fb2826ba747e756002","observation_id":"7f1d55dc-4a08-4c2d-9638-926ef3b9955f","resolution":{"observed_at":"2026-08-14T13:58:53.809048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.795502Z","title":"o rner, Hinrich Sch \\","venue":null,"work_id":"b9f59f8b-9431-4f20-8eed-94011ebe404a","year":2018},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.222736Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:15f53bbb27881b81a4edfd99d472da23cf46c2049b5a0fa7c396524a637f2409","observation_id":"983e18b8-ac7a-4d37-aafb-cf9dfd4c1b9c","resolution":{"observed_at":"2026-08-14T13:58:53.799188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.07913","last_updated":"2020-04-06T20:13:40Z","snapshot_observed_at":"2026-07-06T08:22:30.696468Z","submitted_at":"2019-09-17T16:10:30Z","title":"Learning to Deceive with Attention-Based Explanations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.07913","snapshot_observed_at":"2026-08-14T13:58:53.226145Z","title":"Learning to deceive with attention-based explanations","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.226145Z"},"links":{"cited_paper":"/paper/1909.07913","citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:d0c859f4c8c5a6b1ffd0cbcde19486d7f844d96048980e48bb89e80a81ff4975","observation_id":"1b488205-59dd-4b03-9bbd-983fdfcacb18","resolution":{"observed_at":"2026-08-14T13:58:53.226145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.784728Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":"448224a0-ad2f-47ea-820e-8b4584ae1ea2","year":2018},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.230365Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:d80e8eca9e180968f5ebf6d7e8430bd6a56dadaf09713f48038aec5a71434280","observation_id":"2aba314c-3256-401a-bd92-0d6ae8152117","resolution":{"observed_at":"2026-08-14T13:58:53.788562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.233924Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.233924Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:1d0e8913435119ea2546ec438468415913405be923a348b5e97e966c5ef3f862","observation_id":"8c303378-3295-4f0d-8712-1c01503568b5","resolution":{"observed_at":"2026-08-14T13:58:53.233924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.768734Z","title":"An analysis of encoder representations in transformer-based machine translation","venue":null,"work_id":"5d1c93d4-2816-4b0a-bec1-47b4e89203cf","year":2018},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.237303Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:37cc288f92dddaab2b7dbe5e52afb00c40a8dece09e0ec4ea67f180f2e369740","observation_id":"b0dd69b5-9d9c-4a34-8635-3545333f2194","resolution":{"observed_at":"2026-08-14T13:58:53.772535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.759107Z","title":null,"venue":null,"work_id":"56f22f53-3339-47a0-824f-2d0080c61612","year":2019},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.240733Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:cc7af4a303a25e75e6fc11abffa9f882cfa23fe342be5d9f7df84e959e99646d","observation_id":"cbdcabc2-146d-405d-9a84-621836929db3","resolution":{"observed_at":"2026-08-14T13:58:53.762475Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.748792Z","title":"Deep inside convolutional networks: Visualising image classification models and saliency maps","venue":null,"work_id":"aeec7d71-f3af-40dd-bc5b-e42c7362a3c5","year":2014},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.243984Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:f70fa09b2720c41b73320230fd0ecd57f5f47c8e3bdec5bddb996af4d75005fd","observation_id":"f3055383-139a-4d7b-865a-a6b9ed834aa9","resolution":{"observed_at":"2026-08-14T13:58:53.752493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.737797Z","title":"An analysis of attention mechanisms: The case of word sense disambiguation in neural machine translation","venue":null,"work_id":"8d907dbe-55a2-4900-acb8-c9e7b19838b7","year":2018},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.247752Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:82f3e70208ebc1d8d311ffb971827fdf8b14d17ad4af25dd7e05fa18003c26fe","observation_id":"51e51d98-2b42-4208-a2cc-40c50052d828","resolution":{"observed_at":"2026-08-14T13:58:53.741539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.727630Z","title":"BERT rediscovers the classical NLP pipeline","venue":null,"work_id":"3c46aca0-3dbe-4e39-83a9-70c7cbb8f216","year":2019},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.251204Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:80ae8e2ff8a8287dec5eda654e8f1390b46fa803e97d94e4637c5f8333740f60","observation_id":"fc54cb90-280b-4bab-97bc-fa315fd64163","resolution":{"observed_at":"2026-08-14T13:58:53.731259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.716621Z","title":"Manning, and Yoram Singer","venue":null,"work_id":"7d4b23ec-90d5-4617-af08-c45847260bc5","year":2003},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.254900Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:74dd7ec31ff05007bfbefe656d2e0720004ab4edbac1b0e972da563c65acbba2","observation_id":"8ebab20b-a393-4044-b301-1abe91e82fac","resolution":{"observed_at":"2026-08-14T13:58:53.720737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.705594Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"3d41bf0c-40d5-453a-af48-75e50d5d0ab9","year":2017},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.258734Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:c3b65f8e31e1d8b05912421224838949fc7a71046c9eed7584919d54abd475ca","observation_id":"8ee805d1-e827-4277-a37d-ae2c76c33ad3","resolution":{"observed_at":"2026-08-14T13:58:53.709245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02679","last_updated":"2019-04-11T16:00:53Z","snapshot_observed_at":"2026-08-15T15:16:08.993378Z","submitted_at":"2019-04-04T17:32:49Z","title":"Visualizing Attention in Transformer-Based Language Representation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02679","snapshot_observed_at":"2026-08-14T13:58:53.263300Z","title":"Visualizing attention in transformer-based language representation models","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.263300Z"},"links":{"cited_paper":"/paper/1904.02679","citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:081a9242e5c7f403f6c3b787e15f56dc5be5ff684d56fd29431f238da1af26d2","observation_id":"8cc4927c-8c0a-4bff-b4f7-a3040913da9f","resolution":{"observed_at":"2026-08-14T13:58:53.263300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.695241Z","title":"Analyzing multi-head self-attention: Specialized heads do the heavy lifting, the rest can be pruned","venue":null,"work_id":"3c7f1cdc-6560-4af3-8540-db72d9e00df9","year":2019},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.267102Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:32d9e68ca2c4ce534a567c691a7809a10ff7c150259362333d2769914e838748","observation_id":"59fe64bb-d723-4d37-abf4-51697592ae06","resolution":{"observed_at":"2026-08-14T13:58:53.699096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02825","last_updated":"2019-09-14T20:03:50Z","snapshot_observed_at":"2026-08-14T17:48:21.144772Z","submitted_at":"2018-12-05T03:05:08Z","title":"Attending to Mathematical Language with Transformers","version":5},"cited_work":{"arxiv_id":"1812.02825","doi":null,"metadata_source":"pith","pith_arxiv_id":"1812.02825","snapshot_observed_at":"2026-08-14T13:58:53.510705Z","title":"Attending to Mathematical Language with Transformers","venue":"cs.CL","work_id":"0685748a-9533-4012-9e98-b7ef465832ec","year":2018},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.270806Z"},"links":{"cited_paper":"/paper/1812.02825","citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:fdcc024ecbb01ef070f4cd2bb13878d66ef0f85d7c64a6b4e342083e929fad84","observation_id":"911b3616-1320-4eee-8282-ced3bb6b8995","resolution":{"observed_at":"2026-08-14T13:58:53.516256Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.12471","last_updated":"2019-10-01T18:41:05Z","snapshot_observed_at":"2026-08-14T19:09:01.924152Z","submitted_at":"2018-05-31T13:52:06Z","title":"Neural Network Acceptability Judgments","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.12471","snapshot_observed_at":"2026-08-14T13:58:53.274383Z","title":"Neural network acceptability judgments","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.274383Z"},"links":{"cited_paper":"/paper/1805.12471","citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:60eb3e7210df3ba682db9f1b874435b6bb324da3a0f8a20c872efd8075faf349","observation_id":"6927b9a2-8151-4cfb-8842-5a86d5c179b8","resolution":{"observed_at":"2026-08-14T13:58:53.274383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.04626","last_updated":"2019-09-05T14:11:27Z","snapshot_observed_at":"2026-08-19T04:34:08.104261Z","submitted_at":"2019-08-13T13:15:04Z","title":"Attention is not not Explanation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.04626","snapshot_observed_at":"2026-08-14T13:58:53.278844Z","title":"Attention is not not explanation","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.278844Z"},"links":{"cited_paper":"/paper/1908.04626","citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:2351bec21791308879661c3f1faf3bce6f0df28cd2045eff4b95ca3ab32f6b25","observation_id":"15d4a6e4-ff5e-4b4b-8fb6-8f0d3d46a8e3","resolution":{"observed_at":"2026-08-14T13:58:53.278844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.684319Z","title":"A broad-coverage challenge corpus for sentence understanding through inference","venue":null,"work_id":"807f8f78-7b0a-4ae4-ad1f-5a29b7707b71","year":2018},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.282274Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:704fae3fd9cb6c6770ec35112037dda997b929dcb5d28f2a2d768ffcc0a663b5","observation_id":"7a016438-3966-4496-bc6c-6986f7c23240","resolution":{"observed_at":"2026-08-14T13:58:53.688166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.674357Z","title":"Wong, Fandong Meng, Lidia S","venue":null,"work_id":"1b269b18-7a39-4119-9d1f-49a4c7b80c04","year":2018},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.285788Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:67a6d5d6a8adbc37603e87b88165c75cb0bf6d40051f72273a794cdd2e5d77b2","observation_id":"00d863bf-d16e-4862-9feb-c0e0cd2de30e","resolution":{"observed_at":"2026-08-14T13:58:53.677922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08237","last_updated":"2020-01-02T12:48:08Z","snapshot_observed_at":"2026-07-31T22:49:43.034741Z","submitted_at":"2019-06-19T17:35:48Z","title":"XLNet: Generalized Autoregressive Pretraining for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08237","snapshot_observed_at":"2026-08-14T13:58:53.289063Z","title":null,"venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.289063Z"},"links":{"cited_paper":"/paper/1906.08237","citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:23fcd4e4c243d8575dc71bea7a12f9449232370da0d626d0488c9e6bee7a6fbd","observation_id":"b826a9c6-c782-4432-98aa-dde59e02080e","resolution":{"observed_at":"2026-08-14T13:58:53.289063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.664197Z","title":"Xlnet: Generalized autoregressive pretraining for language understanding","venue":null,"work_id":"02d8c2d5-ab83-4dbe-8a34-0738b5257df6","year":2019},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.292666Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:c69d1f1591e5328f10dc7ee643f3283b981190aa9b705333a024965035f9f1bc","observation_id":"90a6031b-4205-498c-87b8-53be3df748cf","resolution":{"observed_at":"2026-08-14T13:58:53.667814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.11359","last_updated":"2019-01-31T14:05:02Z","snapshot_observed_at":"2026-08-14T17:22:59.910683Z","submitted_at":"2019-01-31T14:05:02Z","title":"Adding Interpretable Attention to Neural Translation Models Improves Word Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.11359","snapshot_observed_at":"2026-08-14T13:58:53.296228Z","title":"Adding interpretable attention to neural translation models improves word alignment","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.296228Z"},"links":{"cited_paper":"/paper/1901.11359","citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:953d25553829470bf2052ad5de94ce504497643043031077bc55993d8a56af69","observation_id":"45cae2cc-f9d7-46ed-a4b8-7fbbda3de17c","resolution":{"observed_at":"2026-08-14T13:58:53.296228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.299911Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.299911Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:0284cb43019804caac7a90b75d642975674a93780ba7ac74e963202dc5e2c7e2","observation_id":"34e9c8d9-06e9-4ad6-b6bc-c94a23fc232a","resolution":{"observed_at":"2026-08-14T13:58:53.299911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.304061Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.304061Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:c055aef5c5d2d89b68d515ca4b184e9c434edf11a0a759cdc1a0846f2bd4853a","observation_id":"83812952-4fdd-469a-bedf-6906bfbd2bbc","resolution":{"observed_at":"2026-08-14T13:58:53.304061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.307636Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.307636Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:e06cd5ff2097233a553bee8184689132e2f8b4226ffa7e44b73d2bc78f035ffa","observation_id":"dc48f631-c6f1-4467-8871-49683fdaa021","resolution":{"observed_at":"2026-08-14T13:58:53.307636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:58:53.311191Z","title":"妤 ' x P·uy n gʅ8Oj D q ^hژ","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers","version":4},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-14T13:58:53.311191Z"},"links":{"citing_paper":"/paper/1908.04211"},"observation_digest":"sha256:7fd250eceb1a5b902d3e3ea939d7442afb02f1dfe7c506de572300262aefd7aa","observation_id":"d5419d0f-fed3-48eb-ae8b-9712cd5eb8c9","resolution":{"observed_at":"2026-08-14T13:58:53.311191Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"1908.04211","last_updated":"2020-02-07T17:44:52Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T12:24:48.299916Z","submitted_at":"2019-08-12T15:48:34Z","title":"On Identifiability in Transformers"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":2,"verified_fuzzy":22},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 7 inbound Pith citation observations for arXiv:1908.04211."}