{"as_of":"2026-08-10T11:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:747ea95b99636e71f0ddfbe3cd1be44574dc17a45c327029d46d2920fbd1377c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:15:22.753088Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T17:37:14.474189Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.06304","last_updated":"2023-07-12T17:01:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T17:01:03Z","title":"Patch n' Pack: NaViT, a Vision Transformer for any Aspect Ratio and Resolution","version":1},"cited_work":{"arxiv_id":"2307.06304","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.06304","snapshot_observed_at":"2026-07-02T17:37:14.474189Z","title":"Patch n’ pack: Navit, a vision trans- former for any aspect ratio and resolution","venue":null,"work_id":"f4256e68-3daf-4978-94b9-39fd1c53038a","year":2023},"citing_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-11T01:19:59.603343Z"},"links":{"cited_paper":"/paper/2307.06304","citing_paper":"/paper/2501.13106"},"observation_digest":"sha256:b5b1833f96df374811a19839581ed6c2dfcb171b94d997d259ae66863e2d2f13","observation_id":"cbf8093d-d53e-4fb6-af22-2200c3191c3a","resolution":{"observed_at":"2026-05-11T01:20:00.250289Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06304","last_updated":"2023-07-12T17:01:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T17:01:03Z","title":"Patch n' Pack: NaViT, a Vision Transformer for any Aspect Ratio and Resolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06304","snapshot_observed_at":"2026-08-07T11:15:22.753088Z","title":"Patch n’pack: Navit, a vision transformer for any aspect ratio and resolution.arXiv preprint arXiv:2307.06304, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T23:51:36.891678Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:22.753088Z"},"links":{"cited_paper":"/paper/2307.06304","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:be5bdff2075582c7e3577cb728710effedecca0f392b8c5b098d45fe9c4811ad","observation_id":"a0eef25d-31f6-4a4f-ac30-1290f02b085f","resolution":{"observed_at":"2026-08-07T11:15:22.753088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06304","last_updated":"2023-07-12T17:01:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T17:01:03Z","title":"Patch n' Pack: NaViT, a Vision Transformer for any Aspect Ratio and Resolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06304","snapshot_observed_at":"2026-08-06T21:46:25.589904Z","title":"Patch n' pack: Navit, a vision transformer for any aspect ratio and resolution, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23589","last_updated":"2025-06-30T07:51:58Z","snapshot_observed_at":"2026-08-08T08:02:50.830843Z","submitted_at":"2025-06-30T07:51:58Z","title":"Transition Matching: Scalable and Flexible Generative Modeling","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T21:46:25.589904Z"},"links":{"cited_paper":"/paper/2307.06304","citing_paper":"/paper/2506.23589"},"observation_digest":"sha256:ea78e99f363cb8e426921964c20217a969761e068148d112e877b560de9613b6","observation_id":"4f99b5eb-d2a5-4734-9c52-5f71ef917b08","resolution":{"observed_at":"2026-08-06T21:46:25.589904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06304","last_updated":"2023-07-12T17:01:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T17:01:03Z","title":"Patch n' Pack: NaViT, a Vision Transformer for any Aspect Ratio and Resolution","version":1},"cited_work":{"arxiv_id":"2307.06304","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.06304","snapshot_observed_at":"2026-07-02T17:37:14.474189Z","title":"Patch n’ pack: Navit, a vision trans- former for any aspect ratio and resolution","venue":null,"work_id":"f4256e68-3daf-4978-94b9-39fd1c53038a","year":2023},"citing_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T16:09:05.225767Z"},"links":{"cited_paper":"/paper/2307.06304","citing_paper":"/paper/2602.02276"},"observation_digest":"sha256:57f3c0f776aea0dd272e41133adef204c0629d3209c90e1b2fc4adf2a039a0ce","observation_id":"755ef971-28dc-4cfa-bb36-474e27f4b3d3","resolution":{"observed_at":"2026-05-10T16:09:05.293386Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06304","last_updated":"2023-07-12T17:01:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T17:01:03Z","title":"Patch n' Pack: NaViT, a Vision Transformer for any Aspect Ratio and Resolution","version":1},"cited_work":{"arxiv_id":"2307.06304","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.06304","snapshot_observed_at":"2026-07-02T17:37:14.474189Z","title":"Patch n’ pack: Navit, a vision trans- former for any aspect ratio and resolution","venue":null,"work_id":"f4256e68-3daf-4978-94b9-39fd1c53038a","year":2023},"citing_paper":{"arxiv_id":"2605.08962","last_updated":"2026-05-09T13:59:27Z","snapshot_observed_at":"2026-07-06T23:21:06.773761Z","submitted_at":"2026-05-09T13:59:27Z","title":"MegaScale-Omni: A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T02:04:07.344134Z"},"links":{"cited_paper":"/paper/2307.06304","citing_paper":"/paper/2605.08962"},"observation_digest":"sha256:b9bec3a043dbb6464bae03100106e618c50e43e00449b8d64840890b69a5bff9","observation_id":"748fd67e-8938-4509-85ac-eea615b63bbd","resolution":{"observed_at":"2026-05-12T02:06:14.948067Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06304","last_updated":"2023-07-12T17:01:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T17:01:03Z","title":"Patch n' Pack: NaViT, a Vision Transformer for any Aspect Ratio and Resolution","version":1},"cited_work":{"arxiv_id":"2307.06304","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.06304","snapshot_observed_at":"2026-07-02T17:37:14.474189Z","title":"Patch n’ pack: Navit, a vision trans- former for any aspect ratio and resolution","venue":null,"work_id":"f4256e68-3daf-4978-94b9-39fd1c53038a","year":2023},"citing_paper":{"arxiv_id":"2605.09151","last_updated":"2026-05-09T20:29:24Z","snapshot_observed_at":"2026-08-07T01:10:01.218480Z","submitted_at":"2026-05-09T20:29:24Z","title":"MultiMedVision: Multi-Modal Medical Vision Framework","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T02:46:23.767997Z"},"links":{"cited_paper":"/paper/2307.06304","citing_paper":"/paper/2605.09151"},"observation_digest":"sha256:029715557470b8f768db9ae8092c3434593692185ba47932e9d0b6d6b939ac02","observation_id":"fd6e7296-5d9f-4715-ba3c-42f40a2ee28a","resolution":{"observed_at":"2026-05-12T07:31:24.710887Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06304","last_updated":"2023-07-12T17:01:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T17:01:03Z","title":"Patch n' Pack: NaViT, a Vision Transformer for any Aspect Ratio and Resolution","version":1},"cited_work":{"arxiv_id":"2307.06304","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.06304","snapshot_observed_at":"2026-07-02T17:37:14.474189Z","title":"Patch n’ pack: Navit, a vision trans- former for any aspect ratio and resolution","venue":null,"work_id":"f4256e68-3daf-4978-94b9-39fd1c53038a","year":2023},"citing_paper":{"arxiv_id":"2606.07861","last_updated":"2026-06-05T21:49:34Z","snapshot_observed_at":"2026-08-02T02:56:55.871904Z","submitted_at":"2026-06-05T21:49:34Z","title":"The Last Visible Pixel: Probing Fine-Scale Perception in Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T21:58:53.702009Z"},"links":{"cited_paper":"/paper/2307.06304","citing_paper":"/paper/2606.07861"},"observation_digest":"sha256:2ac572c5c5d91c915fbca2a6cd1f23ea86cb290b4c601e00025fbd9f284c8911","observation_id":"9230ab26-e9a9-445e-8531-8ac85880edb2","resolution":{"observed_at":"2026-07-02T17:37:14.475654Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06304","last_updated":"2023-07-12T17:01:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T17:01:03Z","title":"Patch n' Pack: NaViT, a Vision Transformer for any Aspect Ratio and Resolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06304","snapshot_observed_at":"2026-08-04T04:53:26.058308Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.14741","last_updated":"2026-08-03T03:39:50Z","snapshot_observed_at":"2026-08-07T16:01:40.359450Z","submitted_at":"2026-06-02T20:31:13Z","title":"HorusEye: Language as Dynamic Attention for Emergency Visual Analysis","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T04:53:26.058308Z"},"links":{"cited_paper":"/paper/2307.06304","citing_paper":"/paper/2606.14741"},"observation_digest":"sha256:2c5251cd49994b1b0fa1943d577d5d3778217794e9655fe7f5d20c771cff83d9","observation_id":"e447ce7f-b94b-4391-95d7-c01f3e347390","resolution":{"observed_at":"2026-08-04T04:53:26.058308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2307.06304/citation-record","integrity":"/paper/2307.06304/integrity","json":"/paper/2307.06304/citation-record.json","paper":"/paper/2307.06304"},"outbound":[],"paper":{"arxiv_id":"2307.06304","last_updated":"2023-07-12T17:01:03Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T17:01:03Z","title":"Patch n' Pack: NaViT, a Vision Transformer for any Aspect Ratio and Resolution"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2307.06304."}