{"as_of":"2026-08-18T09:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a1423c85b25759461effd47c3a7dd76ccf58adb67cec31982ce533443f0a1205","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T04:33:44.783521Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.04635/citation-record","integrity":"/paper/2602.04635/integrity","json":"/paper/2602.04635/citation-record.json","paper":"/paper/2602.04635"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:41.409418Z","title":"Language models as zero-shot planners: Extracting actionable knowledge for embodied agents,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:41.409418Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:537c5bc07a8cae1105136ced117597a231efae0775655552d65ca34ddb14e34a","observation_id":"e022d2a1-c05b-437c-bed2-a80baa129330","resolution":{"observed_at":"2026-08-03T04:33:41.409418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:41.517549Z","title":"Do as i can, not as i say: Grounding language in robotic affordances,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:41.517549Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:a26d8200f4208b02e77ad91f7db07d4e49dcbdf2bcf08d8cb0436a432943a303","observation_id":"90fc7491-8af5-42d4-9c7a-fd11951d56e2","resolution":{"observed_at":"2026-08-03T04:33:41.517549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:41.641597Z","title":"Hydra: A Real-time Spatial Perception System for 3D Scene Graph Construction and Optimiza- tion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:41.641597Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:2a8135bb26bcd363fdaee55f4f88a1a6fc8d97a432dfa7d8eff9d17178cb93a5","observation_id":"f59c2a15-4dc4-44d4-af1f-46331e1f488e","resolution":{"observed_at":"2026-08-03T04:33:41.641597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:41.731226Z","title":"REACT: Real-time Efficient Attribute Clustering and Transfer for Updatable 3D Scene Graph,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:41.731226Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:d092888b94e854b05f1be6ec0b683c2eeffdb13e98c9961f4c5c093445c0f5b0","observation_id":"f684de27-8b38-4505-a271-8732553655a7","resolution":{"observed_at":"2026-08-03T04:33:41.731226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:41.808188Z","title":"VLA-3D: A Dataset for 3D Semantic Scene Understanding and Navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:41.808188Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:aff5173e91f0e41892b9f38cee86b926579b2e343e202145c8051e0962cda20f","observation_id":"218b7a3f-9183-44c2-bc74-7cea5be0d2fc","resolution":{"observed_at":"2026-08-03T04:33:41.808188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:41.987152Z","title":"Beyond bare queries: Open-vocabulary object ground- ing with 3d scene graph,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:41.987152Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:827581d5ac3e9ea34ad046cc6b55d4fd7c4ad4c0eecba51228d433e4ba7dcec4","observation_id":"2c1c57c6-a85f-4b5b-b69b-9a7d8bdf933f","resolution":{"observed_at":"2026-08-03T04:33:41.987152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:42.186523Z","title":"Conceptgraphs: Open-vocabulary 3d scene graphs for perception and planning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:42.186523Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:a73ebd036332b9cf0476cf40a0b9333714fb6997639c197b7678923acb63fa25","observation_id":"a0c1c248-69d9-4379-af01-9daed25ed7bd","resolution":{"observed_at":"2026-08-03T04:33:42.186523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:42.351356Z","title":"Fungraph: Functionality aware 3d scene graphs for language-prompted scene interaction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:42.351356Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:8f85f6d50dc27ac058e0429f94579f40e6c1326760ebae47670d2e9df193e796","observation_id":"d72b3b7b-7f2e-424b-9059-fe38c1eec7a2","resolution":{"observed_at":"2026-08-03T04:33:42.351356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04034","last_updated":"2025-03-06T02:36:59Z","snapshot_observed_at":"2026-08-16T12:52:39.750751Z","submitted_at":"2025-03-06T02:36:59Z","title":"GaussianGraph: 3D Gaussian-based Scene Graph Generation for Open-world Scene Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04034","snapshot_observed_at":"2026-08-03T04:33:42.443026Z","title":"Gaussiangraph: 3d gaussian-based scene graph generation for open-world scene understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:42.443026Z"},"links":{"cited_paper":"/paper/2503.04034","citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:751f7d13485965651eae70a4c996e87a344589f76aadb47d00815a10c7f7f985","observation_id":"cd893af8-2cef-4057-a20f-b3294bf3d282","resolution":{"observed_at":"2026-08-03T04:33:42.443026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:42.563096Z","title":"[Online]","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:42.563096Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:51de12765e295bc478ed03d0cab8be3c4f565108a52c85e31c6859c7ba156193","observation_id":"81bc526c-2b2d-46be-bb52-cc126d1a64d3","resolution":{"observed_at":"2026-08-03T04:33:42.563096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:42.724062Z","title":"High resolution maps from wide an- gle sonar,","venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:42.724062Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:b1f9f0ce2adc1aad6b240b99691026f7a656bc12366ab178a70f13971b38bcc8","observation_id":"1537f2f4-f5bf-46ed-aeed-f72807e4b1a3","resolution":{"observed_at":"2026-08-03T04:33:42.724062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:42.836055Z","title":"Semantic information for robot navigation: A survey,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:42.836055Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:156f3a24740e6d55312ba706e9896d4d171afbc0bab4a0564610c6d548dec35e","observation_id":"9540a5d6-c423-4c4d-b220-0b21e5adbda3","resolution":{"observed_at":"2026-08-03T04:33:42.836055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:42.980788Z","title":"Visual relationship detection: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:42.980788Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:1e7d5cd7e7abaa2119a4275d96bbae9bb6cbd23a5a4c08ad02412b67b74f2734","observation_id":"37e3fef2-7acc-48a0-a520-2ebeaf79e09c","resolution":{"observed_at":"2026-08-03T04:33:42.980788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:43.079285Z","title":"Note on the sampling error of the difference between correlated proportions or percentages,","venue":null,"work_id":null,"year":1947},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:43.079285Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:0ed12d6d3725a0cad12e2890877ae3d74b0031bf3b52762e173f7300bb93191e","observation_id":"8d1cb8fe-b19f-499d-b4e5-84e22bfc833c","resolution":{"observed_at":"2026-08-03T04:33:43.079285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:43.288489Z","title":"ARKitscenes: A diverse real-world dataset for 3d indoor scene understanding using mobile RGB-d data,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:43.288489Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:996ddf10c842ad418354b7913437d69c6b42d6cbf87b278be91547576eaa6517","observation_id":"bcb3fb5a-8bb9-45e5-90f7-34141b38bb93","resolution":{"observed_at":"2026-08-03T04:33:43.288489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:43.414740Z","title":"Habitat-matterport 3d dataset (hm3d): 1000 large-scale 3d environments for embodied ai,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:43.414740Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:2759eff193cba4bc4c9cc3d040f5c4587b97b941de45e16fe2a38de9bea637fc","observation_id":"971489d4-c569-49bf-a780-c814124abf01","resolution":{"observed_at":"2026-08-03T04:33:43.414740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:43.595256Z","title":"Matterport3d: Learning from rgb-d data in indoor environments,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:43.595256Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:98ae1e75a21ea7083b395f97d7bc9f5cb74b669f70752e2d985ab22f4605393e","observation_id":"3645d981-da57-4b39-ab73-004e87c4d5b9","resolution":{"observed_at":"2026-08-03T04:33:43.595256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:43.680574Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:43.680574Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:ad74e68602e519df1aad6efb92a81f4d0d9e50739465545fc14fd2fac2b4a4fc","observation_id":"8e773b5a-0f80-48bd-99d1-56009c6d5aef","resolution":{"observed_at":"2026-08-03T04:33:43.680574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:43.750740Z","title":"Rio: 3d object instance re-localization in changing indoor environments,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:43.750740Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:364b9dba9c7509975d33607f64412d0f79169258254017e7856e6521b914927f","observation_id":"ec69ec21-4159-4850-b2ab-4e97c715d22c","resolution":{"observed_at":"2026-08-03T04:33:43.750740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:43.821035Z","title":"[Online]","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:43.821035Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:222125b3411f37979944ae9263d0825039110d33ba864fbaad24e9cccd4e6f45","observation_id":"51dc82d6-117a-4674-9d0f-4acb0d04851c","resolution":{"observed_at":"2026-08-03T04:33:43.821035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:43.937580Z","title":"VLA-3D Dataset (GitHub Repository),","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:43.937580Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:b366ff5f41c653cb746410bc422d5b1141a707b64db9960bfa0c75a74e72d6bd","observation_id":"313f7e8e-0cec-4132-a503-148e29591312","resolution":{"observed_at":"2026-08-03T04:33:43.937580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:44.105264Z","title":"The design of stretch: A compact, lightweight mobile manipulator for indoor human environments,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:44.105264Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:508c89b74dd0bc38d1a33d48e42faa5feb7fdaa61196d99d352529f8d5a2f580","observation_id":"1a8aa03a-67f3-447e-a9fd-2d3b64ce23c1","resolution":{"observed_at":"2026-08-03T04:33:44.105264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:44.191663Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:44.191663Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:09fa3ded1e43952669016b8afa9e1e8aabc51e068332b91ff475489576ac601e","observation_id":"c4640da1-2ced-4bc8-a5b2-a19ff7e064f8","resolution":{"observed_at":"2026-08-03T04:33:44.191663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:44.286380Z","title":"Panoptic Multi-TSDFs: a Flexible Representation for Online Multi-resolution V olumetric Mapping and Long- term Dynamic Scene Consistency,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:44.286380Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:abd5d816efee4f0de87d9aba86aa9cf9bbade4fbb8723ee55537562226c17f2e","observation_id":"e89d64ec-2ca2-456f-a237-977ccf7174a0","resolution":{"observed_at":"2026-08-03T04:33:44.286380Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:44.384598Z","title":"Ultralytics yolo11,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:44.384598Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:7ae0fb29099a33a9b2dc08c4bbe0ed84cb3a862b6861ff93b111ab4a53f30a20","observation_id":"09829c03-8188-4a38-b922-f6c5f3a23bcd","resolution":{"observed_at":"2026-08-03T04:33:44.384598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:44.476977Z","title":"Sayplan: Grounding large language models using 3d scene graphs for scalable robot task planning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:44.476977Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:d5118a564735188bdc33afed11c69f605cc4414b86608a6be8a65e12080943ea","observation_id":"7b25947b-02aa-47f4-940a-dfa05b13c5cf","resolution":{"observed_at":"2026-08-03T04:33:44.476977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:44.596623Z","title":"Retrieval-augmented generation for knowledge- intensive nlp tasks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:44.596623Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:79986c01dd10b636562f126c88879ff0200c6b3aba2bb0229217fda9eb994c2a","observation_id":"67095b55-a1df-42a6-8342-49960302c42c","resolution":{"observed_at":"2026-08-03T04:33:44.596623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:44.706008Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:44.706008Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:d339586c307428b15a39c152c20cc08b5c8cd9d2d24a4aec450f12f619b6ed00","observation_id":"a90f1f90-2617-45e6-ab8c-7c45aaba01eb","resolution":{"observed_at":"2026-08-03T04:33:44.706008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:44.783521Z","title":"Grammarly,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:44.783521Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:f5c421bda7171778673c916056abcee08b1a6bb60521fffedeb9b89e578407ca","observation_id":"f3503575-ad20-4cb0-b346-a43386a4623f","resolution":{"observed_at":"2026-08-03T04:33:44.783521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:33:44.023417Z","title":"Available: https://github.com/HaochenZ11/VLA-3D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T04:33:44.023417Z"},"links":{"citing_paper":"/paper/2602.04635"},"observation_digest":"sha256:84064f0e44a722d5d9dc6c2474eacb48ed3b64a889329c530ea104b454eef466","observation_id":"a41cf091-91ce-4a65-bc0a-640cd7bf40bb","resolution":{"observed_at":"2026-08-03T04:33:44.023417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.04635","last_updated":"2026-07-30T11:24:04Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-06T16:36:06.802601Z","submitted_at":"2026-02-04T15:05:29Z","title":"Relational Scene Graphs for Object Grounding of Natural Language Commands"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2602.04635."}