{"as_of":"2026-08-20T00:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a5730ceef9f3b4d7f66fcddd2133f9b7d4461d3a3d5fa93ba236e8dc42e9dc0c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":5,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":5,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:06:07.655484Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T22:18:59.687280Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2110.13309","last_updated":"2023-08-17T22:42:07Z","snapshot_observed_at":"2026-08-18T09:10:39.774722Z","submitted_at":"2021-10-25T22:54:41Z","title":"History Aware Multimodal Transformer for Vision-and-Language Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.13309","snapshot_observed_at":"2026-08-11T19:45:35.964434Z","title":"History aware multimodal transformer for vision-and-language navigation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06413","last_updated":"2025-06-25T10:03:04Z","snapshot_observed_at":"2026-08-18T09:09:52.309621Z","submitted_at":"2024-12-09T11:40:54Z","title":"World-Consistent Data Generation for Vision-and-Language Navigation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T19:45:35.964434Z"},"links":{"cited_paper":"/paper/2110.13309","citing_paper":"/paper/2412.06413"},"observation_digest":"sha256:ea77143546ebe66136f01686a148319cb4bb1d981a05257d5ed57744c9eac2b6","observation_id":"8789d29c-01a5-4042-9aca-4ce324fb144b","resolution":{"observed_at":"2026-08-11T19:45:35.964434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13309","last_updated":"2023-08-17T22:42:07Z","snapshot_observed_at":"2026-08-18T09:10:39.774722Z","submitted_at":"2021-10-25T22:54:41Z","title":"History Aware Multimodal Transformer for Vision-and-Language Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.13309","snapshot_observed_at":"2026-08-16T11:06:07.655484Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.655484Z"},"links":{"cited_paper":"/paper/2110.13309","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:5bdcc44aebc69e5e6b601ec4df49189d7ce7a3f712b8cde75c18d2aaf3173713","observation_id":"b4b2cf3f-f1bd-4a7c-883d-2e17e46ea3b5","resolution":{"observed_at":"2026-08-16T11:06:07.655484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13309","last_updated":"2023-08-17T22:42:07Z","snapshot_observed_at":"2026-08-18T09:10:39.774722Z","submitted_at":"2021-10-25T22:54:41Z","title":"History Aware Multimodal Transformer for Vision-and-Language Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.13309","snapshot_observed_at":"2026-08-07T13:52:05.004076Z","title":"History aware multimodal trans- former for vision-and-language navigation.ArXiv, abs/2110.13309, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:05.004076Z"},"links":{"cited_paper":"/paper/2110.13309","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:c7c32dc60661084a317595ef8347162b23b5de925f56f699787517c6c61dff25","observation_id":"0847f6cc-088e-44bf-9095-b2189aa3c309","resolution":{"observed_at":"2026-08-07T13:52:05.004076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13309","last_updated":"2023-08-17T22:42:07Z","snapshot_observed_at":"2026-08-18T09:10:39.774722Z","submitted_at":"2021-10-25T22:54:41Z","title":"History Aware Multimodal Transformer for Vision-and-Language Navigation","version":2},"cited_work":{"arxiv_id":"2110.13309","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.13309","snapshot_observed_at":"2026-07-03T22:18:59.687280Z","title":"History aware mul- timodal transformer for vision-and-language navigation,","venue":null,"work_id":"30b029a4-e2e5-441b-a916-c53a5cc18bcb","year":2021},"citing_paper":{"arxiv_id":"2606.31654","last_updated":"2026-07-02T11:38:15Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T13:33:48Z","title":"DynFly: Dynamic-Aware Continuous Trajectory Generation for UAV Vision-Language Navigation in Urban Environments","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-01T05:35:32.213470Z"},"links":{"cited_paper":"/paper/2110.13309","citing_paper":"/paper/2606.31654"},"observation_digest":"sha256:ae44b5f32800ff73a4f469a19eb8bf21a3472c9a7062d14fe88ce9fa929a208b","observation_id":"de01dbeb-fe75-44da-bdc9-fbfed964309c","resolution":{"observed_at":"2026-07-01T10:25:41.234051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13309","last_updated":"2023-08-17T22:42:07Z","snapshot_observed_at":"2026-08-18T09:10:39.774722Z","submitted_at":"2021-10-25T22:54:41Z","title":"History Aware Multimodal Transformer for Vision-and-Language Navigation","version":2},"cited_work":{"arxiv_id":"2110.13309","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.13309","snapshot_observed_at":"2026-07-03T22:18:59.687280Z","title":"History aware mul- timodal transformer for vision-and-language navigation,","venue":null,"work_id":"30b029a4-e2e5-441b-a916-c53a5cc18bcb","year":2021},"citing_paper":{"arxiv_id":"2606.31654","last_updated":"2026-07-02T11:38:15Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T13:33:48Z","title":"DynFly: Dynamic-Aware Continuous Trajectory Generation for UAV Vision-Language Navigation in Urban Environments","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-03T22:11:44.933463Z"},"links":{"cited_paper":"/paper/2110.13309","citing_paper":"/paper/2606.31654"},"observation_digest":"sha256:dcda79947b19b6ac7e59bdc21ba999780fc2434eb16882e2733bfa122601cf0b","observation_id":"828bcc94-75df-46bc-b2f0-6852eb9f1eed","resolution":{"observed_at":"2026-07-03T22:18:59.689024Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2110.13309/citation-record","integrity":"/paper/2110.13309/integrity","json":"/paper/2110.13309/citation-record.json","paper":"/paper/2110.13309"},"outbound":[],"paper":{"arxiv_id":"2110.13309","last_updated":"2023-08-17T22:42:07Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T09:10:39.774722Z","submitted_at":"2021-10-25T22:54:41Z","title":"History Aware Multimodal Transformer for Vision-and-Language Navigation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 5 inbound Pith citation observations for arXiv:2110.13309."}