{"as_of":"2026-08-08T20:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8f6fdd16326fc96b876551bfbf1d8f42f44c504a36468b34a35af678607a60f9","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T19:24:18.962558Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:09:56.509722Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":"2102.10882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-04T16:09:56.509722Z","title":"arXiv preprint arXiv:2102.10882 (2021)","venue":null,"work_id":"9f145ff7-f3ac-4d97-9656-6ca087883dda","year":2021},"citing_paper":{"arxiv_id":"2103.14030","last_updated":"2021-08-17T16:41:34Z","snapshot_observed_at":"2026-08-07T00:32:15.123562Z","submitted_at":"2021-03-25T17:59:31Z","title":"Swin Transformer: Hierarchical Vision Transformer using Shifted Windows","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T19:27:56.785857Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2103.14030"},"observation_digest":"sha256:3f63be8c62258c8653ed143851e6a6296e72185f32f7bc77f17d042098671d4c","observation_id":"2212ddb7-89fa-46a9-899e-e24b0331cab8","resolution":{"observed_at":"2026-05-15T19:27:56.944252Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":"2102.10882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-04T16:09:56.509722Z","title":"arXiv preprint arXiv:2102.10882 (2021)","venue":null,"work_id":"9f145ff7-f3ac-4d97-9656-6ca087883dda","year":2021},"citing_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"reference_index":211,"source":"arxiv_source","source_observed_at":"2026-05-14T23:07:42.245641Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2303.16199"},"observation_digest":"sha256:fd24d05aa729f65bc0f5f61664d39a9b640dd5420084a82e5e623c1fb3af1f9a","observation_id":"27655d9f-a601-4848-8062-06195cc422f0","resolution":{"observed_at":"2026-05-14T23:07:42.452808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":"2102.10882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-04T16:09:56.509722Z","title":"arXiv preprint arXiv:2102.10882 (2021)","venue":null,"work_id":"9f145ff7-f3ac-4d97-9656-6ca087883dda","year":2021},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:29ee37b397ec0af23808a3008cbcd873edfab9e2ad8192a80b616a183ee6974a","observation_id":"20bf5ead-4004-41af-b2ca-25e534e3039a","resolution":{"observed_at":"2026-05-16T07:02:53.836536Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":"2102.10882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-04T16:09:56.509722Z","title":"arXiv preprint arXiv:2102.10882 (2021)","venue":null,"work_id":"9f145ff7-f3ac-4d97-9656-6ca087883dda","year":2021},"citing_paper":{"arxiv_id":"2408.12406","last_updated":"2026-04-03T03:35:40Z","snapshot_observed_at":"2026-08-04T04:50:28.469898Z","submitted_at":"2024-08-22T13:58:08Z","title":"Generalized SAM: Efficient Fine-Tuning of SAM for Variable Input Image Sizes","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-23T21:26:32.186947Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2408.12406"},"observation_digest":"sha256:8d18fad55298db75ad0d061dc7479bffd8087cfa1ac8b896f429358ddb99d24d","observation_id":"db8502d9-d9ca-4485-8058-95c3c5ec85a8","resolution":{"observed_at":"2026-05-23T21:28:27.563406Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-08-07T19:24:18.962558Z","title":"arXiv preprint arXiv:2102.10882 15","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.10120","last_updated":"2025-02-17T07:35:28Z","snapshot_observed_at":"2026-08-07T19:16:45.419857Z","submitted_at":"2025-02-14T12:40:37Z","title":"Compress image to patches for Vision Transformer","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T19:24:18.962558Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2502.10120"},"observation_digest":"sha256:ddcba94080703d3646dd4da3a52403adcc82b18eb9609ec40f8b3d6236be2029","observation_id":"f33ecc9f-ff1d-466d-a9ce-f4532aee6c24","resolution":{"observed_at":"2026-08-07T19:24:18.962558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":"2102.10882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-04T16:09:56.509722Z","title":"arXiv preprint arXiv:2102.10882 (2021)","venue":null,"work_id":"9f145ff7-f3ac-4d97-9656-6ca087883dda","year":2021},"citing_paper":{"arxiv_id":"2504.14386","last_updated":"2026-04-10T20:17:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-19T19:20:47Z","title":"LOOPE: Learnable Optimal Patch Order in Positional Embeddings for Vision Transformers","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T18:18:56.091429Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2504.14386"},"observation_digest":"sha256:a392e24fc622ac118ee9ad59a3164676da95981a8e94c37cc3f8f73f31311753","observation_id":"2513cc64-b3f4-40ec-a2c8-d7071577fe94","resolution":{"observed_at":"2026-05-22T18:21:55.991100Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-08-07T11:13:58.611323Z","title":"Conditional positional encodings for vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03110","last_updated":"2025-06-03T17:40:36Z","snapshot_observed_at":"2026-08-07T11:06:06.409679Z","submitted_at":"2025-06-03T17:40:36Z","title":"Revisiting Continuity of Image Tokens for Cross-domain Few-shot Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:13:58.611323Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2506.03110"},"observation_digest":"sha256:a65bc908aba9c62d17eab51f5ba439cc897410977f79026737a3ee3803e74c8f","observation_id":"2849dda0-aaaa-4426-8844-c9eb5ed6b04a","resolution":{"observed_at":"2026-08-07T11:13:58.611323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-08-07T04:43:40.606136Z","title":"Conditional positional encodings for vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-07T21:45:10.885875Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:40.606136Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:74e82ca4cacff76912c5d52c625e861cab947ffdad8dc00602eb68c57ab23a85","observation_id":"dcc5ce5f-76eb-4247-8dea-4353601196d6","resolution":{"observed_at":"2026-08-07T04:43:40.606136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-08-06T18:32:09.704815Z","title":"Conditional positional encodings for vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08178","last_updated":"2025-07-10T21:19:30Z","snapshot_observed_at":"2026-08-06T18:22:41.726828Z","submitted_at":"2025-07-10T21:19:30Z","title":"Cracking Instance Jigsaw Puzzles: An Alternative to Multiple Instance Learning for Whole Slide Image Analysis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:09.704815Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2507.08178"},"observation_digest":"sha256:5a4598d9a288a67528d0563edfad0d317b9fe879eef42f6ac72ab6610d06f611","observation_id":"d3a3f5fd-6340-46d1-af72-99fcbb171e40","resolution":{"observed_at":"2026-08-06T18:32:09.704815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-08-06T15:19:59.017983Z","title":"Condi- tional positional encodings for vision transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16260","last_updated":"2025-07-22T06:17:44Z","snapshot_observed_at":"2026-08-07T12:15:46.752138Z","submitted_at":"2025-07-22T06:17:44Z","title":"ToFe: Lagged Token Freezing and Reusing for Efficient Vision Transformer Inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:59.017983Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2507.16260"},"observation_digest":"sha256:fa9663b71a9b12ddce2b1025c5637ec7c47cca20cea60bebf91abcd6d474bd3a","observation_id":"8987f68c-8c40-440b-bc33-52f6ac536e7a","resolution":{"observed_at":"2026-08-06T15:19:59.017983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-08-05T17:13:11.776775Z","title":"Zihang Dai, Zhilin Yang, Yiming Yang, Jaime Carbonell, Quoc V","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18308","last_updated":"2025-08-23T08:02:07Z","snapshot_observed_at":"2026-08-06T17:55:19.594772Z","submitted_at":"2025-08-23T08:02:07Z","title":"CoPE: A Lightweight Complex Positional Encoding","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:11.776775Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2508.18308"},"observation_digest":"sha256:c61bfca738965735ebd58531f380b3de2f0806dc47b5c069f84c2fb3a5f23883","observation_id":"38c2ff56-6dd6-4526-84fb-d3c22f7b6628","resolution":{"observed_at":"2026-08-05T17:13:11.776775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-08-05T10:36:59.387017Z","title":"Conditional positional encodings for vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.03973","last_updated":"2025-09-04T07:58:52Z","snapshot_observed_at":"2026-08-05T10:36:57.332431Z","submitted_at":"2025-09-04T07:58:52Z","title":"SAC-MIL: Spatial-Aware Correlated Multiple Instance Learning for Histopathology Whole Slide Image Classification","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:59.387017Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2509.03973"},"observation_digest":"sha256:a7c5be949d874564b69638906f7932c8a7329cfa38e0d23532c6aebbc3ace1b5","observation_id":"b24d652f-9c45-4d74-a47d-4d3de200c058","resolution":{"observed_at":"2026-08-05T10:36:59.387017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":"2102.10882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-04T16:09:56.509722Z","title":"arXiv preprint arXiv:2102.10882 (2021)","venue":null,"work_id":"9f145ff7-f3ac-4d97-9656-6ca087883dda","year":2021},"citing_paper":{"arxiv_id":"2604.05215","last_updated":"2026-04-06T22:27:36Z","snapshot_observed_at":"2026-07-06T22:54:00.211106Z","submitted_at":"2026-04-06T22:27:36Z","title":"Hierarchical Mesh Transformers with Topology-Guided Pretraining for Morphometric Analysis of Brain Structures","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T19:08:21.736766Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2604.05215"},"observation_digest":"sha256:b7b21c9296ab5d9b2ac729e87ea6a64fd407ae5865471a6e8ab143830f7ebadd","observation_id":"ba805d2e-9a36-4721-9bb3-b04ec0ed478a","resolution":{"observed_at":"2026-05-10T23:25:54.006092Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":"2102.10882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-04T16:09:56.509722Z","title":"arXiv preprint arXiv:2102.10882 (2021)","venue":null,"work_id":"9f145ff7-f3ac-4d97-9656-6ca087883dda","year":2021},"citing_paper":{"arxiv_id":"2604.21035","last_updated":"2026-04-22T19:29:41Z","snapshot_observed_at":"2026-07-30T11:22:05.443849Z","submitted_at":"2026-04-22T19:29:41Z","title":"Masked-Token Prediction for Anomaly Detection at the Large Hadron Collider","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-09T23:24:59.497990Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2604.21035"},"observation_digest":"sha256:115efd7824b3088ab1b9918e012b719b67534d1bcfd952c2417bd2a9f36f96f2","observation_id":"8183770e-7660-4844-a811-e3bc34453479","resolution":{"observed_at":"2026-05-11T14:11:04.330841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":"2102.10882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-04T16:09:56.509722Z","title":"arXiv preprint arXiv:2102.10882 (2021)","venue":null,"work_id":"9f145ff7-f3ac-4d97-9656-6ca087883dda","year":2021},"citing_paper":{"arxiv_id":"2605.11131","last_updated":"2026-05-11T18:40:13Z","snapshot_observed_at":"2026-07-06T23:23:02.025664Z","submitted_at":"2026-05-11T18:40:13Z","title":"USEMA: a Scalable Efficient Mamba Like Attention for Medical Image Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T07:13:37.134769Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2605.11131"},"observation_digest":"sha256:49502af25906ab025520c669d055b6c240777033687d91b48d5a6bd0cbdd8d56","observation_id":"7bee24b5-3fa0-4a53-b292-afdb8feb4d2d","resolution":{"observed_at":"2026-05-13T07:17:29.569616Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":"2102.10882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-04T16:09:56.509722Z","title":"arXiv preprint arXiv:2102.10882 (2021)","venue":null,"work_id":"9f145ff7-f3ac-4d97-9656-6ca087883dda","year":2021},"citing_paper":{"arxiv_id":"2605.25949","last_updated":"2026-05-25T15:27:43Z","snapshot_observed_at":"2026-08-02T05:39:31.031529Z","submitted_at":"2026-05-25T15:27:43Z","title":"Small Models, Strong Priors: Architectural Inductive Bias for Parameter-Efficient Neural PDE Solvers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T22:14:36.959998Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2605.25949"},"observation_digest":"sha256:69899cb995c4a3cffd11bc94fa611001109f1016c8bbc2ee344fb03545e8c35a","observation_id":"52959f8e-ec8f-4b95-9285-f7f071eae726","resolution":{"observed_at":"2026-06-29T22:24:00.986789Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":"2102.10882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-04T16:09:56.509722Z","title":"arXiv preprint arXiv:2102.10882 (2021)","venue":null,"work_id":"9f145ff7-f3ac-4d97-9656-6ca087883dda","year":2021},"citing_paper":{"arxiv_id":"2606.09659","last_updated":"2026-06-08T15:43:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-08T15:43:16Z","title":"End-to-End Context Compression at Scale","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-27T16:36:54.699174Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2606.09659"},"observation_digest":"sha256:3d252fe6654ff6ac9976cb186a84e695541372ff78744753f51b5aba93272e36","observation_id":"931c443e-be63-4654-9069-576441a40e0f","resolution":{"observed_at":"2026-07-03T01:27:30.487775Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":"2102.10882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-04T16:09:56.509722Z","title":"arXiv preprint arXiv:2102.10882 (2021)","venue":null,"work_id":"9f145ff7-f3ac-4d97-9656-6ca087883dda","year":2021},"citing_paper":{"arxiv_id":"2606.24498","last_updated":"2026-06-23T12:30:04Z","snapshot_observed_at":"2026-08-05T20:07:28.394395Z","submitted_at":"2026-06-23T12:30:04Z","title":"VistaRef: Boosting Visual Spatial Orientation Awareness for Pointing-to-Object Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T00:59:43.745654Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2606.24498"},"observation_digest":"sha256:b8a2ec17e48c17dfcdff5cf9cd3ba89df130c6bc7ee44698bde601ceaa0c9e2a","observation_id":"13d8427a-7d78-401a-a191-d5817240c59b","resolution":{"observed_at":"2026-07-04T16:09:56.511381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":"2102.10882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-04T16:09:56.509722Z","title":"arXiv preprint arXiv:2102.10882 (2021)","venue":null,"work_id":"9f145ff7-f3ac-4d97-9656-6ca087883dda","year":2021},"citing_paper":{"arxiv_id":"2606.31585","last_updated":"2026-06-30T12:38:58Z","snapshot_observed_at":"2026-07-07T00:05:17.259491Z","submitted_at":"2026-06-30T12:38:58Z","title":"DPPE: Rethinking Camera-Based Positional Encoding for Scaling Multi-View Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-01T05:39:21.642584Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2606.31585"},"observation_digest":"sha256:1c669e12db316029626bd6e9e11bd768184bb550a1e8300a9f77757d80e2ba98","observation_id":"9a359755-f395-4fbc-ac6d-50e024e99554","resolution":{"observed_at":"2026-07-01T10:15:44.815071Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":"2102.10882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-04T16:09:56.509722Z","title":"arXiv preprint arXiv:2102.10882 (2021)","venue":null,"work_id":"9f145ff7-f3ac-4d97-9656-6ca087883dda","year":2021},"citing_paper":{"arxiv_id":"2607.00249","last_updated":"2026-06-30T22:58:09Z","snapshot_observed_at":"2026-08-06T17:00:22.997717Z","submitted_at":"2026-06-30T22:58:09Z","title":"Device Passport: Enabling Spatio-Temporal Pretrained Models to Generalize Across Input Layouts","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-02T19:32:45.679147Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2607.00249"},"observation_digest":"sha256:4db8ca0f3dd5698a0ab3faea7484b5190509b8768b897e06c7d9b278d7fe338f","observation_id":"b6aec985-8936-44c3-9c7e-4bb20c02a4c6","resolution":{"observed_at":"2026-07-02T19:37:18.453593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-07-13T02:23:52.225787Z","title":"& Shen, C","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09526","last_updated":"2026-07-10T15:35:06Z","snapshot_observed_at":"2026-08-08T05:28:49.414817Z","submitted_at":"2026-07-10T15:35:06Z","title":"ALICE: Learning a General-Purpose Pathology Foundation Model from Vision, Vision-Language, and Slide-Level Experts","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T02:23:52.225787Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2607.09526"},"observation_digest":"sha256:5f55c0e92de59cc04492529069104a6dbc34800bf148b9cd1dd9dea88a998e43","observation_id":"e08238e2-1901-404b-bb4c-ab96f4a925c0","resolution":{"observed_at":"2026-07-13T02:23:52.225787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2102.10882/citation-record","integrity":"/paper/2102.10882/integrity","json":"/paper/2102.10882/citation-record.json","paper":"/paper/2102.10882"},"outbound":[],"paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T12:12:32.479948Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 21 inbound Pith citation observations for arXiv:2102.10882."}