{"as_of":"2026-08-08T21:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bdf983ca5e96db897a56e8f333b99c8776ee983ed7d9e9f8c8fbdec096d828f9","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":5,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":5,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:59:05.102006Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":56,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2104.11227","last_updated":"2021-04-22T17:59:45Z","snapshot_observed_at":"2026-07-06T11:02:49.722095Z","submitted_at":"2021-04-22T17:59:45Z","title":"Multiscale Vision Transformers","version":1},"cited_work":{"arxiv_id":"2104.11227","doi":"10.48550/arxiv.2104.11227","metadata_source":"arxiv_reference","pith_arxiv_id":"2104.11227","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multiscale","venue":"arXiv (Cornell University)","work_id":"eb1ddae3-b799-4973-acc8-7294aafc7e90","year":2021},"citing_paper":{"arxiv_id":"2502.05564","last_updated":"2025-05-24T08:05:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-08T13:25:04Z","title":"TabICL: A Tabular Foundation Model for In-Context Learning on Large Data","version":2},"reference_index":146,"source":"arxiv_source","source_observed_at":"2026-05-20T13:35:02.018244Z"},"links":{"cited_paper":"/paper/2104.11227","citing_paper":"/paper/2502.05564"},"observation_digest":"sha256:13f7dea44f111dc2795afdb6fdd8cfd1ffcac0166fa9e3f5739d51969c004254","observation_id":"e89d6ad3-b568-453e-866c-041368fe98c7","resolution":{"observed_at":"2026-05-20T13:35:02.145880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.11227","last_updated":"2021-04-22T17:59:45Z","snapshot_observed_at":"2026-07-06T11:02:49.722095Z","submitted_at":"2021-04-22T17:59:45Z","title":"Multiscale Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.11227","snapshot_observed_at":"2026-08-05T10:59:05.102006Z","title":"Multiscale vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-05T10:59:04.362274Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.102006Z"},"links":{"cited_paper":"/paper/2104.11227","citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:6271155e44f9d1914f478bfca88cc6c0385683288664723a8431f967d7dcb8ea","observation_id":"22a43343-5c80-46be-b353-e8b2756ea021","resolution":{"observed_at":"2026-08-05T10:59:05.102006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.11227","last_updated":"2021-04-22T17:59:45Z","snapshot_observed_at":"2026-07-06T11:02:49.722095Z","submitted_at":"2021-04-22T17:59:45Z","title":"Multiscale Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.11227","snapshot_observed_at":"2026-08-02T22:51:40.930317Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.15505","last_updated":"2026-07-27T15:41:06Z","snapshot_observed_at":"2026-08-03T00:32:28.105177Z","submitted_at":"2026-02-17T11:22:20Z","title":"Binge Watch: Reproducible Multimodal Benchmarks Datasets for Large-Scale Movie Recommendation on MovieLens-10M and 20M","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:40.930317Z"},"links":{"cited_paper":"/paper/2104.11227","citing_paper":"/paper/2602.15505"},"observation_digest":"sha256:4e5d1870c682ac1fd3a38062ed9f3fa38066032a5fc58858165c2c5eff9db32d","observation_id":"704b4fe3-874c-4e3b-8cd9-9fb4c2f7e189","resolution":{"observed_at":"2026-08-02T22:51:40.930317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.11227","last_updated":"2021-04-22T17:59:45Z","snapshot_observed_at":"2026-07-06T11:02:49.722095Z","submitted_at":"2021-04-22T17:59:45Z","title":"Multiscale Vision Transformers","version":1},"cited_work":{"arxiv_id":"2104.11227","doi":"10.48550/arxiv.2104.11227","metadata_source":"arxiv_reference","pith_arxiv_id":"2104.11227","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multiscale","venue":"arXiv (Cornell University)","work_id":"eb1ddae3-b799-4973-acc8-7294aafc7e90","year":2021},"citing_paper":{"arxiv_id":"2604.20760","last_updated":"2026-04-22T16:48:43Z","snapshot_observed_at":"2026-08-04T10:29:14.353844Z","submitted_at":"2026-04-22T16:48:43Z","title":"Exploring High-Order Self-Similarity for Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T00:59:03.890135Z"},"links":{"cited_paper":"/paper/2104.11227","citing_paper":"/paper/2604.20760"},"observation_digest":"sha256:1069f687935ebd7b85951cfbf5e77cc334dc1eae9fc9f6ae259ea13887447807","observation_id":"abec9720-0c1a-4b1a-b665-a4e175880518","resolution":{"observed_at":"2026-05-10T00:59:49.413541Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.11227","last_updated":"2021-04-22T17:59:45Z","snapshot_observed_at":"2026-07-06T11:02:49.722095Z","submitted_at":"2021-04-22T17:59:45Z","title":"Multiscale Vision Transformers","version":1},"cited_work":{"arxiv_id":"2104.11227","doi":"10.48550/arxiv.2104.11227","metadata_source":"arxiv_reference","pith_arxiv_id":"2104.11227","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multiscale","venue":"arXiv (Cornell University)","work_id":"eb1ddae3-b799-4973-acc8-7294aafc7e90","year":2021},"citing_paper":{"arxiv_id":"2606.23118","last_updated":"2026-06-22T10:03:37Z","snapshot_observed_at":"2026-08-08T08:28:10.044726Z","submitted_at":"2026-06-22T10:03:37Z","title":"LUMINA-26: Low-Light Understanding for Modeling and Interpreting Night-time Actions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T09:29:07.142013Z"},"links":{"cited_paper":"/paper/2104.11227","citing_paper":"/paper/2606.23118"},"observation_digest":"sha256:d9a2663a787fa7b7caf3afb4a200c5ee9c83a86813c6412910994531347bbb84","observation_id":"d29c174f-9cf5-4bee-af2c-304a4f449c31","resolution":{"observed_at":"2026-07-04T09:49:44.406828Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2104.11227/citation-record","integrity":"/paper/2104.11227/integrity","json":"/paper/2104.11227/citation-record.json","paper":"/paper/2104.11227"},"outbound":[],"paper":{"arxiv_id":"2104.11227","last_updated":"2021-04-22T17:59:45Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T11:02:49.722095Z","submitted_at":"2021-04-22T17:59:45Z","title":"Multiscale Vision Transformers"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 5 inbound Pith citation observations for arXiv:2104.11227."}