{"as_of":"2026-08-15T12:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c95f23c4bfa5c1dce54a4ab147401ed7c527a7a7b16b442b4b86ac1d43932393","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T12:41:12.098137Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T13:46:59.276291Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.03540","last_updated":"2024-11-05T22:42:41Z","snapshot_observed_at":"2026-08-14T22:11:29.051465Z","submitted_at":"2024-11-05T22:42:41Z","title":"VLA-3D: A Dataset for 3D Semantic Scene Understanding and Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03540","snapshot_observed_at":"2026-08-12T12:41:12.098137Z","title":"Vla-3d: A dataset for 3d semantic scene understanding and navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-15T03:46:03.131206Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:12.098137Z"},"links":{"cited_paper":"/paper/2411.03540","citing_paper":"/paper/2411.17030"},"observation_digest":"sha256:b76c336b0bc6d508ed934b5e6f95bc8b4434fde18dbbf6a2c6db74a7f7f9a2d3","observation_id":"4120d482-e917-4997-adff-0b203aa3310c","resolution":{"observed_at":"2026-08-12T12:41:12.098137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03540","last_updated":"2024-11-05T22:42:41Z","snapshot_observed_at":"2026-08-14T22:11:29.051465Z","submitted_at":"2024-11-05T22:42:41Z","title":"VLA-3D: A Dataset for 3D Semantic Scene Understanding and Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03540","snapshot_observed_at":"2026-08-10T22:32:38.762057Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01366","last_updated":"2025-07-07T20:17:31Z","snapshot_observed_at":"2026-08-11T22:16:36.261774Z","submitted_at":"2025-01-02T17:20:41Z","title":"ViGiL3D: A Linguistically Diverse Dataset for 3D Visual Grounding","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T22:32:38.762057Z"},"links":{"cited_paper":"/paper/2411.03540","citing_paper":"/paper/2501.01366"},"observation_digest":"sha256:3cae923d28e690db931c08db49d080d7b83940d48f4cd738ab3f182e04893b39","observation_id":"00a6a9ff-b569-4f25-8ffc-99650bfb25cf","resolution":{"observed_at":"2026-08-10T22:32:38.762057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03540","last_updated":"2024-11-05T22:42:41Z","snapshot_observed_at":"2026-08-14T22:11:29.051465Z","submitted_at":"2024-11-05T22:42:41Z","title":"VLA-3D: A Dataset for 3D Semantic Scene Understanding and Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03540","snapshot_observed_at":"2026-08-07T14:23:17.792745Z","title":"Vla-3d: A dataset for 3d semantic scene understanding and navigation.arXiv preprint arXiv:2411.03540,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-13T23:10:23.707893Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.792745Z"},"links":{"cited_paper":"/paper/2411.03540","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:887128f0cdd50f96ed64aa499a9f9159fa656e4a211e242a42fd64e85d57743b","observation_id":"9dd4cd40-e528-408a-997d-5924fa5503a6","resolution":{"observed_at":"2026-08-07T14:23:17.792745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03540","last_updated":"2024-11-05T22:42:41Z","snapshot_observed_at":"2026-08-14T22:11:29.051465Z","submitted_at":"2024-11-05T22:42:41Z","title":"VLA-3D: A Dataset for 3D Semantic Scene Understanding and Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03540","snapshot_observed_at":"2026-08-06T22:33:36.514744Z","title":"Vla-3d: A dataset for 3d semantic scene understanding and navigation.arXiv preprint arXiv:2411.03540, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21357","last_updated":"2025-06-26T15:09:23Z","snapshot_observed_at":"2026-08-12T08:20:30.393878Z","submitted_at":"2025-06-26T15:09:23Z","title":"CoPa-SG: Dense Scene Graphs with Parametric and Proto-Relations","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:33:36.514744Z"},"links":{"cited_paper":"/paper/2411.03540","citing_paper":"/paper/2506.21357"},"observation_digest":"sha256:c956bcafed0287a5f03a574938d496469d65b93fce742a99ab428361d9dd630e","observation_id":"f8f6596b-e07d-4d5d-a0a3-fd7df6035b2e","resolution":{"observed_at":"2026-08-06T22:33:36.514744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03540","last_updated":"2024-11-05T22:42:41Z","snapshot_observed_at":"2026-08-14T22:11:29.051465Z","submitted_at":"2024-11-05T22:42:41Z","title":"VLA-3D: A Dataset for 3D Semantic Scene Understanding and Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03540","snapshot_observed_at":"2026-08-06T18:37:21.399482Z","title":"Vla-3d: A dataset for 3d semantic scene understanding and navigation.arXiv preprint arXiv: 2411.03540, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-08-14T01:52:25.774586Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:37:21.399482Z"},"links":{"cited_paper":"/paper/2411.03540","citing_paper":"/paper/2507.07781"},"observation_digest":"sha256:bd56033f81cd5dd54bc85b2946b839d840f7e3aae21348de86533d4280b5a26e","observation_id":"4253dfeb-ddb6-4e97-9581-e8379f3a1fde","resolution":{"observed_at":"2026-08-06T18:37:21.399482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03540","last_updated":"2024-11-05T22:42:41Z","snapshot_observed_at":"2026-08-14T22:11:29.051465Z","submitted_at":"2024-11-05T22:42:41Z","title":"VLA-3D: A Dataset for 3D Semantic Scene Understanding and Navigation","version":1},"cited_work":{"arxiv_id":"2411.03540","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.03540","snapshot_observed_at":"2026-07-02T13:46:59.276291Z","title":"arXiv preprint arXiv:2411.03540 , year=","venue":null,"work_id":"f3777c5c-4723-4356-bb70-f5f2e611920a","year":2024},"citing_paper":{"arxiv_id":"2604.17800","last_updated":"2026-04-20T04:46:20Z","snapshot_observed_at":"2026-08-13T00:43:49.688771Z","submitted_at":"2026-04-20T04:46:20Z","title":"ReFineVLA: Multimodal Reasoning-Aware Generalist Robotic Policies via Teacher-Guided Fine-Tuning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:38.517652Z"},"links":{"cited_paper":"/paper/2411.03540","citing_paper":"/paper/2604.17800"},"observation_digest":"sha256:8ea0194938f26017255a0df519f6727dd306369a1892edec841183cf8348b38d","observation_id":"2c9024c7-290e-4bb5-bb0f-8db2a053f47f","resolution":{"observed_at":"2026-05-10T09:48:48.323410Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03540","last_updated":"2024-11-05T22:42:41Z","snapshot_observed_at":"2026-08-14T22:11:29.051465Z","submitted_at":"2024-11-05T22:42:41Z","title":"VLA-3D: A Dataset for 3D Semantic Scene Understanding and Navigation","version":1},"cited_work":{"arxiv_id":"2411.03540","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.03540","snapshot_observed_at":"2026-07-02T13:46:59.276291Z","title":"arXiv preprint arXiv:2411.03540 , year=","venue":null,"work_id":"f3777c5c-4723-4356-bb70-f5f2e611920a","year":2024},"citing_paper":{"arxiv_id":"2605.10484","last_updated":"2026-05-11T12:44:18Z","snapshot_observed_at":"2026-08-14T11:48:37.110083Z","submitted_at":"2026-05-11T12:44:18Z","title":"OpenSGA: Efficient 3D Scene Graph Alignment in the Open World","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-12T05:00:14.274206Z"},"links":{"cited_paper":"/paper/2411.03540","citing_paper":"/paper/2605.10484"},"observation_digest":"sha256:0102dde437c9d54a70c7301835317ebca566a5eca85c9d24fd06911a08abe92f","observation_id":"ba60899d-1508-4f29-8247-c158956bdbd9","resolution":{"observed_at":"2026-05-12T05:46:26.750346Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03540","last_updated":"2024-11-05T22:42:41Z","snapshot_observed_at":"2026-08-14T22:11:29.051465Z","submitted_at":"2024-11-05T22:42:41Z","title":"VLA-3D: A Dataset for 3D Semantic Scene Understanding and Navigation","version":1},"cited_work":{"arxiv_id":"2411.03540","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.03540","snapshot_observed_at":"2026-07-02T13:46:59.276291Z","title":"arXiv preprint arXiv:2411.03540 , year=","venue":null,"work_id":"f3777c5c-4723-4356-bb70-f5f2e611920a","year":2024},"citing_paper":{"arxiv_id":"2606.06556","last_updated":"2026-06-04T10:43:14Z","snapshot_observed_at":"2026-08-09T06:57:25.072034Z","submitted_at":"2026-06-04T10:43:14Z","title":"Robots Need More than VLA and World Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-28T01:01:33.530167Z"},"links":{"cited_paper":"/paper/2411.03540","citing_paper":"/paper/2606.06556"},"observation_digest":"sha256:f967d727a71d2395d5c7c94d3a6b7b1b9ef842ac8c2fdd3369e295cfbcf05d6f","observation_id":"dfa44da5-df0d-4d4d-9cf4-9c0f6fb8c1cf","resolution":{"observed_at":"2026-07-02T13:46:59.277731Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03540","last_updated":"2024-11-05T22:42:41Z","snapshot_observed_at":"2026-08-14T22:11:29.051465Z","submitted_at":"2024-11-05T22:42:41Z","title":"VLA-3D: A Dataset for 3D Semantic Scene Understanding and Navigation","version":1},"cited_work":{"arxiv_id":"2411.03540","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.03540","snapshot_observed_at":"2026-07-02T13:46:59.276291Z","title":"arXiv preprint arXiv:2411.03540 , year=","venue":null,"work_id":"f3777c5c-4723-4356-bb70-f5f2e611920a","year":2024},"citing_paper":{"arxiv_id":"2606.31144","last_updated":"2026-06-30T05:17:02Z","snapshot_observed_at":"2026-08-14T22:12:13.915374Z","submitted_at":"2026-06-30T05:17:02Z","title":"A Modular Vision-Language-Action Robotics Framework for Indoor Environments","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-01T05:41:48.645193Z"},"links":{"cited_paper":"/paper/2411.03540","citing_paper":"/paper/2606.31144"},"observation_digest":"sha256:634948cb4e6ad760cb182bb0d2582b1f6b8c3c418e824f43a585a551c85b4e0c","observation_id":"79dc6da3-0529-4937-a259-9994ee1bbb31","resolution":{"observed_at":"2026-07-01T10:15:44.461456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.03540/citation-record","integrity":"/paper/2411.03540/integrity","json":"/paper/2411.03540/citation-record.json","paper":"/paper/2411.03540"},"outbound":[],"paper":{"arxiv_id":"2411.03540","last_updated":"2024-11-05T22:42:41Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-14T22:11:29.051465Z","submitted_at":"2024-11-05T22:42:41Z","title":"VLA-3D: A Dataset for 3D Semantic Scene Understanding and Navigation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2411.03540."}