{"as_of":"2026-08-12T12:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:73018a91ee1ab6f5218e37ab40b0123cfc01617f70bf330fc87d3bc2eb845d6e","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:53:52.304925Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:05:02.502481Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T21:56:15.441801Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.18288","last_updated":"2024-12-24T08:52:06Z","snapshot_observed_at":"2026-08-11T08:47:25.320854Z","submitted_at":"2024-12-24T08:52:06Z","title":"Towards understanding how attention mechanism works in deep learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18288","snapshot_observed_at":"2026-08-05T20:59:36.897052Z","title":"Towards understanding how attention mechanism works in deep learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09627","last_updated":"2025-08-13T08:59:04Z","snapshot_observed_at":"2026-08-06T15:53:16.127835Z","submitted_at":"2025-08-13T08:59:04Z","title":"Physics- and geometry-aware spatio-spectral graph neural operator for time-independent and time-dependent PDEs","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-05T20:59:36.897052Z"},"links":{"cited_paper":"/paper/2412.18288","citing_paper":"/paper/2508.09627"},"observation_digest":"sha256:600f5021ed57c1333e030c340b0412e0a45c44aeb70bfcba913e9ec6d3f41a7e","observation_id":"fe4b9dc8-3e46-43ed-9d3a-6f8ce3ca128e","resolution":{"observed_at":"2026-08-05T20:59:36.897052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18288","last_updated":"2024-12-24T08:52:06Z","snapshot_observed_at":"2026-08-11T08:47:25.320854Z","submitted_at":"2024-12-24T08:52:06Z","title":"Towards understanding how attention mechanism works in deep learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18288","snapshot_observed_at":"2026-08-05T21:05:02.502481Z","title":"Towards understanding how attention mechanism works in deep learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09628","last_updated":"2025-08-13T08:59:13Z","snapshot_observed_at":"2026-08-08T15:12:43.884415Z","submitted_at":"2025-08-13T08:59:13Z","title":"Attention's forward pass and Frank-Wolfe","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-05T21:05:02.502481Z"},"links":{"cited_paper":"/paper/2412.18288","citing_paper":"/paper/2508.09628"},"observation_digest":"sha256:59b7937c3e3ce5e3dc35b43db7f9280c2b3d6e7142d0e88ae3900efc19f70439","observation_id":"02f2568a-cf97-47ad-8fe9-c5fa3b1a24af","resolution":{"observed_at":"2026-08-05T21:05:02.502481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18288","last_updated":"2024-12-24T08:52:06Z","snapshot_observed_at":"2026-08-11T08:47:25.320854Z","submitted_at":"2024-12-24T08:52:06Z","title":"Towards understanding how attention mechanism works in deep learning","version":1},"cited_work":{"arxiv_id":"2412.18288","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.18288","snapshot_observed_at":"2026-07-01T21:56:15.441801Z","title":"Towards understanding how attention mechanism works in deep learning","venue":null,"work_id":"acad5ae8-042d-4436-b6ba-a1df8aba5f9c","year":2024},"citing_paper":{"arxiv_id":"2509.04154","last_updated":"2026-08-08T06:27:20Z","snapshot_observed_at":"2026-08-12T12:14:50.701184Z","submitted_at":"2025-09-04T12:29:14Z","title":"Robust Filter Attention: Self-Attention as Precision-Weighted State Estimation","version":5},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-18T18:56:48.722344Z"},"links":{"cited_paper":"/paper/2412.18288","citing_paper":"/paper/2509.04154"},"observation_digest":"sha256:a9a2cf4872f3684130498adf9968d195cf932f604d14e1a288e3a044ba2475c1","observation_id":"5745ca25-4c14-4d87-9b02-61d40e725aa0","resolution":{"observed_at":"2026-05-18T19:01:46.313882Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18288","last_updated":"2024-12-24T08:52:06Z","snapshot_observed_at":"2026-08-11T08:47:25.320854Z","submitted_at":"2024-12-24T08:52:06Z","title":"Towards understanding how attention mechanism works in deep learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18288","snapshot_observed_at":"2026-08-05T10:25:17.199621Z","title":"Towards understanding how attention mechanism works in deep learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04154","last_updated":"2026-08-08T06:27:20Z","snapshot_observed_at":"2026-08-12T12:14:50.701184Z","submitted_at":"2025-09-04T12:29:14Z","title":"Robust Filter Attention: Self-Attention as Precision-Weighted State Estimation","version":9},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-05T10:25:17.199621Z"},"links":{"cited_paper":"/paper/2412.18288","citing_paper":"/paper/2509.04154"},"observation_digest":"sha256:842db65e5d2bae6ab768089c405ed47c299e07673306628eee9ae07b72434d94","observation_id":"bf9ec9b5-68dd-413d-ac48-f943d92837ce","resolution":{"observed_at":"2026-08-05T10:25:17.199621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18288","last_updated":"2024-12-24T08:52:06Z","snapshot_observed_at":"2026-08-11T08:47:25.320854Z","submitted_at":"2024-12-24T08:52:06Z","title":"Towards understanding how attention mechanism works in deep learning","version":1},"cited_work":{"arxiv_id":"2412.18288","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.18288","snapshot_observed_at":"2026-07-01T21:56:15.441801Z","title":"Towards understanding how attention mechanism works in deep learning","venue":null,"work_id":"acad5ae8-042d-4436-b6ba-a1df8aba5f9c","year":2024},"citing_paper":{"arxiv_id":"2606.01563","last_updated":"2026-06-01T02:08:40Z","snapshot_observed_at":"2026-08-06T03:26:36.028360Z","submitted_at":"2026-06-01T02:08:40Z","title":"MomentKV: Closing the Directional Gap in KV Cache Eviction for Long-Context Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T16:07:22.196982Z"},"links":{"cited_paper":"/paper/2412.18288","citing_paper":"/paper/2606.01563"},"observation_digest":"sha256:715dbae7f1a5c44649a07f30202da24128db2d8c0c0a0ffefc8bc38b7b751aea","observation_id":"d1740aba-fbd5-4a2a-bea8-58baccbf15cd","resolution":{"observed_at":"2026-07-01T21:56:15.443916Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18288","last_updated":"2024-12-24T08:52:06Z","snapshot_observed_at":"2026-08-11T08:47:25.320854Z","submitted_at":"2024-12-24T08:52:06Z","title":"Towards understanding how attention mechanism works in deep learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18288","snapshot_observed_at":"2026-07-14T10:03:27.747512Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10677","last_updated":"2026-07-12T09:44:54Z","snapshot_observed_at":"2026-08-10T07:20:24.653668Z","submitted_at":"2026-07-12T09:44:54Z","title":"From Self-Attention to Connection Laplacian: A Unified Operator View of Transformers","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-14T10:03:27.747512Z"},"links":{"cited_paper":"/paper/2412.18288","citing_paper":"/paper/2607.10677"},"observation_digest":"sha256:203782b00f06e985da54b40e8bcee83d38ebda93cea802f376dc6899858ca4f3","observation_id":"4368ff3f-46d2-4554-b36c-331c141bbd05","resolution":{"observed_at":"2026-07-14T10:03:27.747512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.18288/citation-record","integrity":"/paper/2412.18288/integrity","json":"/paper/2412.18288/citation-record.json","paper":"/paper/2412.18288"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:53:52.616986Z","title":"Proof: Denote the matrix of exp {fθ(xi, xj)} by W","venue":null,"work_id":"e8ce73ee-9a7d-4d06-8964-51504da18a3f","year":2006},"citing_paper":{"arxiv_id":"2412.18288","last_updated":"2024-12-24T08:52:06Z","snapshot_observed_at":"2026-08-11T08:47:25.320854Z","submitted_at":"2024-12-24T08:52:06Z","title":"Towards understanding how attention mechanism works in deep learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T04:53:52.304925Z"},"links":{"citing_paper":"/paper/2412.18288"},"observation_digest":"sha256:8cc735dcdf89afef8c6078306344fd55e3c4750ae41dd831d5347ff8bd3a72c7","observation_id":"2f13138d-311a-40f9-8657-5c4d8e79a5a8","resolution":{"observed_at":"2026-08-11T04:53:52.621405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:53:52.645718Z","title":"We conducted all experiments on a desktop computer with NVIDIA 2080Ti and 3.8 GHz AMD Ryzen 7 5800X 8-Core Process and 16 GB of memory and a computer with NVIDIA 3090Ti","venue":null,"work_id":"97a05a22-d218-4304-a570-ba7548e8fe1b","year":2019},"citing_paper":{"arxiv_id":"2412.18288","last_updated":"2024-12-24T08:52:06Z","snapshot_observed_at":"2026-08-11T08:47:25.320854Z","submitted_at":"2024-12-24T08:52:06Z","title":"Towards understanding how attention mechanism works in deep learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T04:53:52.295114Z"},"links":{"citing_paper":"/paper/2412.18288"},"observation_digest":"sha256:a160da1ef405c064d15b399f5ca4527c0b0ff69c45a94673c967973f3234e10e","observation_id":"138ac479-0c9f-4912-a910-d84cdb8ba9ba","resolution":{"observed_at":"2026-08-11T04:53:52.651971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10794","last_updated":"2025-08-21T11:31:09Z","snapshot_observed_at":"2026-08-10T12:03:25.806428Z","submitted_at":"2023-12-17T19:06:29Z","title":"A mathematical perspective on Transformers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10794","snapshot_observed_at":"2026-08-11T04:53:52.247956Z","title":"A mathematical perspective on transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18288","last_updated":"2024-12-24T08:52:06Z","snapshot_observed_at":"2026-08-11T08:47:25.320854Z","submitted_at":"2024-12-24T08:52:06Z","title":"Towards understanding how attention mechanism works in deep learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T04:53:52.247956Z"},"links":{"cited_paper":"/paper/2312.10794","citing_paper":"/paper/2412.18288"},"observation_digest":"sha256:753fa3c3fa125cbd085d8e8bc0a95e7c60c50aa87ceb271e52a346c549f55d12","observation_id":"c84a1717-e171-4b54-a7a6-394f2527b763","resolution":{"observed_at":"2026-08-11T04:53:52.247956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.03426","last_updated":"2020-09-18T01:56:41Z","snapshot_observed_at":"2026-08-02T15:32:07.466568Z","submitted_at":"2018-02-09T19:39:33Z","title":"UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.03426","snapshot_observed_at":"2026-08-11T04:53:52.257258Z","title":"Umap: Uniform manifold approximation and projection for dimension reduction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18288","last_updated":"2024-12-24T08:52:06Z","snapshot_observed_at":"2026-08-11T08:47:25.320854Z","submitted_at":"2024-12-24T08:52:06Z","title":"Towards understanding how attention mechanism works in deep learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T04:53:52.257258Z"},"links":{"cited_paper":"/paper/1802.03426","citing_paper":"/paper/2412.18288"},"observation_digest":"sha256:58f4ab1502fc8c544db978687a2e9637e82264ef6c3ed9f5df345e7e46ccfd91","observation_id":"1aef1b6c-3581-4434-bbbe-2b2ca271c7e7","resolution":{"observed_at":"2026-08-11T04:53:52.257258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.10903","last_updated":"2018-02-04T19:13:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-10-30T12:41:12Z","title":"Graph Attention Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.10903","snapshot_observed_at":"2026-08-11T04:53:52.267529Z","title":"Graph attention networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18288","last_updated":"2024-12-24T08:52:06Z","snapshot_observed_at":"2026-08-11T08:47:25.320854Z","submitted_at":"2024-12-24T08:52:06Z","title":"Towards understanding how attention mechanism works in deep learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T04:53:52.267529Z"},"links":{"cited_paper":"/paper/1710.10903","citing_paper":"/paper/2412.18288"},"observation_digest":"sha256:760141acd752129379ee8dee5956352da2505a876f6d9351c2c5ec8ac49949c2","observation_id":"bd099c74-af2d-4578-beda-60b558401f39","resolution":{"observed_at":"2026-08-11T04:53:52.267529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:53:52.281360Z","title":"URL http://dx.doi.org/10.18653/v1/2023.findings-acl","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18288","last_updated":"2024-12-24T08:52:06Z","snapshot_observed_at":"2026-08-11T08:47:25.320854Z","submitted_at":"2024-12-24T08:52:06Z","title":"Towards understanding how attention mechanism works in deep learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T04:53:52.281360Z"},"links":{"citing_paper":"/paper/2412.18288"},"observation_digest":"sha256:6d341bdfe79576384b39afdf0bb7f609f7220d416eca3f5ba984964fd3fd15f8","observation_id":"d0e99909-dadb-4cf5-9784-4e12ffffaf4a","resolution":{"observed_at":"2026-08-11T04:53:52.281360Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:53:52.662865Z","title":"Experiments and results T oy dataset We evaluated the performance of metric-attention by comparing it with self-attention and L2 self-attention using the Moon dataset","venue":null,"work_id":"accd7f29-e9ea-471f-9c77-e69096022370","year":2011},"citing_paper":{"arxiv_id":"2412.18288","last_updated":"2024-12-24T08:52:06Z","snapshot_observed_at":"2026-08-11T08:47:25.320854Z","submitted_at":"2024-12-24T08:52:06Z","title":"Towards understanding how attention mechanism works in deep learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T04:53:52.290604Z"},"links":{"citing_paper":"/paper/2412.18288"},"observation_digest":"sha256:01df87e41895442bf6858b49df6c2e9eae916219edbb0bbe6c8da5db96c31371","observation_id":"9a4d7c30-78d5-4f86-ac62-e1cd680c8a91","resolution":{"observed_at":"2026-08-11T04:53:52.668163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:53:52.630829Z","title":"We adapted the implementation for the Multi30k dataset from https://github.com/hyunwoongko/transformer","venue":null,"work_id":"b700ce9d-de5d-492c-878a-5a2dc3be9133","year":2006},"citing_paper":{"arxiv_id":"2412.18288","last_updated":"2024-12-24T08:52:06Z","snapshot_observed_at":"2026-08-11T08:47:25.320854Z","submitted_at":"2024-12-24T08:52:06Z","title":"Towards understanding how attention mechanism works in deep learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T04:53:52.299600Z"},"links":{"citing_paper":"/paper/2412.18288"},"observation_digest":"sha256:3141fc5b9d0111df67c2800560b78c0f2249c8a3d9c3be4431b0b90424670e10","observation_id":"4508e9b1-f2a9-4128-b533-6fbaf5af89bd","resolution":{"observed_at":"2026-08-11T04:53:52.635416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.10228","last_updated":"2024-06-09T06:22:48Z","snapshot_observed_at":"2026-07-06T08:23:47.781534Z","submitted_at":"2019-09-23T08:55:41Z","title":"Manifold Fitting under Unbounded Noise","version":3},"cited_work":{"arxiv_id":"1909.10228","doi":null,"metadata_source":"pith","pith_arxiv_id":"1909.10228","snapshot_observed_at":"2026-08-11T04:53:52.365702Z","title":"Manifold Fitting under Unbounded Noise","venue":"stat.ML","work_id":"17d78cfb-527b-4699-97e5-e43a5cc6fd70","year":2019},"citing_paper":{"arxiv_id":"2412.18288","last_updated":"2024-12-24T08:52:06Z","snapshot_observed_at":"2026-08-11T08:47:25.320854Z","submitted_at":"2024-12-24T08:52:06Z","title":"Towards understanding how attention mechanism works in deep learning","version":1},"reference_index":482,"source":"pdf_text","source_observed_at":"2026-08-11T04:53:52.285731Z"},"links":{"cited_paper":"/paper/1909.10228","citing_paper":"/paper/2412.18288"},"observation_digest":"sha256:2f5102fd531a5b5e2f25cf5a4cd73961f72c7a51f3a9b516436b1ac73876edd4","observation_id":"bad485c5-fcff-4998-ae70-c902cac0c231","resolution":{"observed_at":"2026-08-11T04:53:52.373924Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.09235","last_updated":"2026-06-26T14:41:00Z","snapshot_observed_at":"2026-08-11T14:00:09.556372Z","submitted_at":"2021-02-18T09:37:49Z","title":"Deep Residual Networks Learn the Geodesic Curve in the Wasserstein Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.09235","snapshot_observed_at":"2026-08-11T04:53:52.243199Z","title":"A mathematical principle of deep learning: Learn the geodesic curve in the wasserstein space","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18288","last_updated":"2024-12-24T08:52:06Z","snapshot_observed_at":"2026-08-11T08:47:25.320854Z","submitted_at":"2024-12-24T08:52:06Z","title":"Towards understanding how attention mechanism works in deep learning","version":1},"reference_index":1985,"source":"pdf_text","source_observed_at":"2026-08-11T04:53:52.243199Z"},"links":{"cited_paper":"/paper/2102.09235","citing_paper":"/paper/2412.18288"},"observation_digest":"sha256:34d7440837a00d0707f1e30682f1bb0bf10e295d4c727acdab91faf8fc7cbd92","observation_id":"611a4699-9001-492a-b267-f481b1831bd0","resolution":{"observed_at":"2026-08-11T04:53:52.243199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:53:52.277386Z","title":"doi: https://doi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18288","last_updated":"2024-12-24T08:52:06Z","snapshot_observed_at":"2026-08-11T08:47:25.320854Z","submitted_at":"2024-12-24T08:52:06Z","title":"Towards understanding how attention mechanism works in deep learning","version":1},"reference_index":1987,"source":"pdf_text","source_observed_at":"2026-08-11T04:53:52.277386Z"},"links":{"citing_paper":"/paper/2412.18288"},"observation_digest":"sha256:7c000a1037f33a4a5034e7ca9cb8b8ce35078f64d8db33ca8fb44b2f7a4f472b","observation_id":"ddbd2e32-7146-4b56-a5b2-1a9bf150283c","resolution":{"observed_at":"2026-08-11T04:53:52.277386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-11T04:53:52.262557Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.18288","last_updated":"2024-12-24T08:52:06Z","snapshot_observed_at":"2026-08-11T08:47:25.320854Z","submitted_at":"2024-12-24T08:52:06Z","title":"Towards understanding how attention mechanism works in deep learning","version":1},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-11T04:53:52.262557Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2412.18288"},"observation_digest":"sha256:9f5c902f31277c53b16c0ac9517c1aadb16a905ebd10a6daba30b6f50cceb0e4","observation_id":"c56f8573-1ad9-4b88-a1ef-60f37596e575","resolution":{"observed_at":"2026-08-11T04:53:52.262557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.02876","last_updated":"2020-07-20T13:57:49Z","snapshot_observed_at":"2026-08-08T20:55:50.425044Z","submitted_at":"2020-07-06T16:42:24Z","title":"A Mathematical Theory of Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.02876","snapshot_observed_at":"2026-08-11T04:53:52.272809Z","title":"A mathematical theory of attention","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2412.18288","last_updated":"2024-12-24T08:52:06Z","snapshot_observed_at":"2026-08-11T08:47:25.320854Z","submitted_at":"2024-12-24T08:52:06Z","title":"Towards understanding how attention mechanism works in deep learning","version":1},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-11T04:53:52.272809Z"},"links":{"cited_paper":"/paper/2007.02876","citing_paper":"/paper/2412.18288"},"observation_digest":"sha256:19e4e25d5b24d31735eb579b3e3eab9aedee5280aca0d2e0f8c5efc869477b6f","observation_id":"a82944c5-dcb1-44ad-ae9b-4fc8c7682e65","resolution":{"observed_at":"2026-08-11T04:53:52.272809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:53:52.715015Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":"bafdeea1-8e8d-4fce-a513-5a3c5c2fc31d","year":1901},"citing_paper":{"arxiv_id":"2412.18288","last_updated":"2024-12-24T08:52:06Z","snapshot_observed_at":"2026-08-11T08:47:25.320854Z","submitted_at":"2024-12-24T08:52:06Z","title":"Towards understanding how attention mechanism works in deep learning","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-11T04:53:52.215981Z"},"links":{"citing_paper":"/paper/2412.18288"},"observation_digest":"sha256:7d454f3a066c5780d8f2d3ba3ae2bafe9c6d8942fe0068044a3220d761b9e261","observation_id":"e87404cd-b3f6-4a3a-bfdf-a0ad21ef621e","resolution":{"observed_at":"2026-08-11T04:53:52.720224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-11T04:53:52.221496Z","title":"BERT: Pre- training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18288","last_updated":"2024-12-24T08:52:06Z","snapshot_observed_at":"2026-08-11T08:47:25.320854Z","submitted_at":"2024-12-24T08:52:06Z","title":"Towards understanding how attention mechanism works in deep learning","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-11T04:53:52.221496Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2412.18288"},"observation_digest":"sha256:dea7cf8b699eee7a59234e9ba1d07bf8eba5231a2782f91a6c1c2616b17d81bb","observation_id":"a1cc6f57-d9fd-4fef-9c04-c32af807122d","resolution":{"observed_at":"2026-08-11T04:53:52.221496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:53:52.729242Z","title":"Scale-invariant heat kernel signatures for non- rigid shape recognition","venue":null,"work_id":"9569da2c-9bee-499f-87a9-1af402367990","year":2010},"citing_paper":{"arxiv_id":"2412.18288","last_updated":"2024-12-24T08:52:06Z","snapshot_observed_at":"2026-08-11T08:47:25.320854Z","submitted_at":"2024-12-24T08:52:06Z","title":"Towards understanding how attention mechanism works in deep learning","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-11T04:53:52.210049Z"},"links":{"citing_paper":"/paper/2412.18288"},"observation_digest":"sha256:51e6a3b79d423eefc1f644b6472cd62fc998ffcffd665544815d8755605ab288","observation_id":"b06985d4-25c0-4357-8667-253b52eac369","resolution":{"observed_at":"2026-08-11T04:53:52.733661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1605.00459","last_updated":"2016-05-02T12:38:03Z","snapshot_observed_at":"2026-08-10T08:50:45.165052Z","submitted_at":"2016-05-02T12:38:03Z","title":"Multi30K: Multilingual English-German Image Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.00459","snapshot_observed_at":"2026-08-11T04:53:52.237619Z","title":"Desmond Elliott, Stella Frank, Khalil Sima’an, and Lucia Specia","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18288","last_updated":"2024-12-24T08:52:06Z","snapshot_observed_at":"2026-08-11T08:47:25.320854Z","submitted_at":"2024-12-24T08:52:06Z","title":"Towards understanding how attention mechanism works in deep learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T04:53:52.237619Z"},"links":{"cited_paper":"/paper/1605.00459","citing_paper":"/paper/2412.18288"},"observation_digest":"sha256:7f1d287de371f91a4db1ab0c2379c4a9b6ac487511465bacedec0e75dd43a6b5","observation_id":"8d2806b5-461b-4c3a-8637-bdc8401350fd","resolution":{"observed_at":"2026-08-11T04:53:52.237619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T04:53:52.232364Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.18288","last_updated":"2024-12-24T08:52:06Z","snapshot_observed_at":"2026-08-11T08:47:25.320854Z","submitted_at":"2024-12-24T08:52:06Z","title":"Towards understanding how attention mechanism works in deep learning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T04:53:52.232364Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.18288"},"observation_digest":"sha256:79b4b48bfbf514a5c019a9c89a10c23e60fad555c565f82f28634c73ef422775","observation_id":"cefb950e-77b6-4e3f-ad29-dbdfc3a6a3f0","resolution":{"observed_at":"2026-08-11T04:53:52.232364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:53:52.695570Z","title":"Speech-transformer: A no-recurrence sequence- to-sequence model for speech recognition","venue":null,"work_id":"24d345e6-4ed7-4a2a-9463-8ba044fd8981","year":2018},"citing_paper":{"arxiv_id":"2412.18288","last_updated":"2024-12-24T08:52:06Z","snapshot_observed_at":"2026-08-11T08:47:25.320854Z","submitted_at":"2024-12-24T08:52:06Z","title":"Towards understanding how attention mechanism works in deep learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T04:53:52.227828Z"},"links":{"citing_paper":"/paper/2412.18288"},"observation_digest":"sha256:7e994592658d5e52f0b7f9f864aa9cd8c7889c0b65654ef2da87bd88bec8910d","observation_id":"e47f16bc-e2a8-4ea4-bb8e-8ec16c936997","resolution":{"observed_at":"2026-08-11T04:53:52.703501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:53:52.678352Z","title":"Shape retrieval contest 2007: Wa- tertight models track","venue":null,"work_id":"206ee0a0-4e09-46fd-aa2a-8b321ecaff59","year":2007},"citing_paper":{"arxiv_id":"2412.18288","last_updated":"2024-12-24T08:52:06Z","snapshot_observed_at":"2026-08-11T08:47:25.320854Z","submitted_at":"2024-12-24T08:52:06Z","title":"Towards understanding how attention mechanism works in deep learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T04:53:52.252781Z"},"links":{"citing_paper":"/paper/2412.18288"},"observation_digest":"sha256:55f8bf640c7e49e430af6f2fef6ab017c790dc3ad5248716fe7dfd443a52cfcd","observation_id":"114cfe83-b128-435b-9dc4-0ad77db2f974","resolution":{"observed_at":"2026-08-11T04:53:52.684496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.18288","last_updated":"2024-12-24T08:52:06Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T08:47:25.320854Z","submitted_at":"2024-12-24T08:52:06Z","title":"Towards understanding how attention mechanism works in deep learning"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":1,"verified_fuzzy":8},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 6 inbound Pith citation observations for arXiv:2412.18288."}