{"as_of":"2026-08-21T12:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:84d8cab66c2243b966712e9ceedaba61cf430f43761a6996cdb574086679a351","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T05:50:02.529790Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.30101/citation-record","integrity":"/paper/2606.30101/integrity","json":"/paper/2606.30101/citation-record.json","paper":"/paper/2606.30101"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"A survey of robot learning from demon- stration.Robotics and autonomous systems, 57(5):469–483,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:83407e13c8a93e212d337c4b5d891b3de27fde286036e9ad214aa0a1a0a5b23a","observation_id":"224c3256-0df9-4d9c-a707-1c64bed71e3a","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-13T13:59:48.091257Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":"2310.08864","doi":"10.48550/arxiv.2310.08864","metadata_source":"pith","pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","venue":"cs.RO","work_id":"62f0fb6c-e6ae-4dc4-95a4-d9dd64b240e8","year":2023},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:0df9dae1e36b2cda5af33ec97958a121287c47ac79a08da993067b9c5d25e5bc","observation_id":"f2e8130a-10d1-42ed-be91-f34c5aeff82d","resolution":{"observed_at":"2026-06-30T05:54:18.857746Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"One-shot imitation learning with graph neural networks for pick-and- place manipulation tasks.IEEE Robotics and Automation Letters, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:613ef7f30b1a0861b776353dcabcf486b6eab9c0236609f6d7b915453b78ede2","observation_id":"0bca1e6d-68c5-448e-b5e8-e360698ceb88","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Goal-conditioned imitation learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:2cdb9c0007aca6dfbfcc2ec86b62945c7edc8a23246b16bf950e60c6aa78e35c","observation_id":"4444edac-6c68-4e80-a6ca-6d00a2bafe7c","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Towards fusing point cloud and visual representations for imitation learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:e2c894473547d16e8c9471760450662917d9f7661992dc44bc6690eda072eb27","observation_id":"9792e759-189c-4762-8f83-ca14e20d5f85","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Imitation from observation using rl and graph-based repre- sentation of demonstrations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:8b2d6b97ac81c40515be0dc5392103b1edb8b44fcfe8a9eaf448acb588655a92","observation_id":"1808b77d-e124-48a8-93c8-5d123cde7345","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Conceptgraphs: Open-vocabulary 3d scene graphs for per- ception and planning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:70ef9d8dabb57fced91752b9ade5d2dee388e208fa683a9bad86e97258000205","observation_id":"aa4ce6f6-da31-409d-b697-a333ee738436","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Aditya Prakash, and Wei Jin","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:d455d2862578b079445cee3a8d9637f151addc88e072bf429e519eb70777d10e","observation_id":"b503b490-5106-48cb-8d9c-e55f5978ebeb","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:0c1c53b6db5216099805434b8d9ba065606b166fd37d1c971b8f21881ff19555","observation_id":"95198377-12a7-48dc-93eb-4629078b5f88","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"VIRL: Self-supervised visual graph inverse reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:8ac59b1550e394f65c65ab385f8a55d760f2102b0c3907c53d49ee906c53b0c3","observation_id":"33202c53-d7a3-4ffc-a88d-a8eafbcb32ad","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Graph inverse reinforcement learning from diverse videos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:4963a2676ce3b1050aebcf075e69f18f8324a4582abfca0feaff87a8b09ce1f6","observation_id":"ce79666c-49a4-4a1c-8b3a-fcbeb3954848","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Self-Attention Graph Pooling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:7b01e1d3f70d3fb8a527aa223a5cad3faf3da9910e70ada58509c489e8e6b21c","observation_id":"5a27611f-1b4b-421a-80c1-432ad29602ac","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06869","last_updated":"2025-03-10T02:44:36Z","snapshot_observed_at":"2026-08-20T07:42:10.132080Z","submitted_at":"2025-03-10T02:44:36Z","title":"Collective Behavior Clone with Visual Attention via Neural Interaction Graph Prediction","version":1},"cited_work":{"arxiv_id":"2503.06869","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.06869","snapshot_observed_at":"2026-06-30T05:54:18.865308Z","title":"Collective behavior clone with visual attention via neural interaction graph prediction.arXiv preprint arXiv:2503.06869, 2025","venue":null,"work_id":"f6bbd11d-1240-4e24-abbe-e2664bb9bd5c","year":2025},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"cited_paper":"/paper/2503.06869","citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:078e851a897106c3caaf7d31c782f2532f8c72b7e4c5df74977e30a46f324c73","observation_id":"2e269927-0b69-4fc7-a3f0-521a43e8e122","resolution":{"observed_at":"2026-06-30T05:54:18.867089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Multi-objective photoreal simulation (mops) dataset for computer vision in robotic manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:1e520c1b2d33b83484afc96907b59484b3e939cc13f10c57d9b18abc9fa20a59","observation_id":"2f90810f-0ddc-4add-9aff-d9e2b8307592","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Efficient and interpretable robot manipulation with graph neural networks.IEEE Robotics and Automation Let- ters, 7(2):2740–2747, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:a1b503627c7b23fa0caf522ab60892b1c6a6933d61015df32a7794210ea872d9","observation_id":"2c662bb0-4aa3-4db0-8048-9384d4140f8e","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12644","last_updated":"2023-11-21T14:44:51Z","snapshot_observed_at":"2026-08-17T19:40:16.163483Z","submitted_at":"2023-11-21T14:44:51Z","title":"Careful Selection and Thoughtful Discarding: Graph Explicit Pooling Utilizing Discarded Nodes","version":1},"cited_work":{"arxiv_id":"2311.12644","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.12644","snapshot_observed_at":"2026-06-30T05:54:18.868284Z","title":"Careful Selection and Thoughtful Discarding: Graph Explicit Pooling Utiliz- ing Discarded Nodes, 2023","venue":null,"work_id":"9bcd10dc-1fe5-4d6e-8c45-0642a18e79d0","year":2023},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"cited_paper":"/paper/2311.12644","citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:95c25b0007c0c4656b9639bef4bcd8136d04e91bc5a456da7a42f07d8e6033b8","observation_id":"08f5287d-7081-4397-bc5c-606a1d8caef7","resolution":{"observed_at":"2026-06-30T05:54:18.870095Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"What mat- ters in learning from offline human demonstrations for robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:ac1022948dd209ebbeaec7314c7bb6cc966390be59bb2397191883c205a56030","observation_id":"072808b2-5576-449b-a445-f873cb7f1ee5","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Calvin: A benchmark for language- conditioned policy learning for long-horizon robot manip- ulation tasks.IEEE Robotics and Automation Letters, 7(3): 7327–7334, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:cdc1cdebca41a1b893e94751029288dc9ee9205bb7f278212710a93f21ed82a7","observation_id":"3728108e-724a-4569-b9ce-3b68c81e6d97","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Robocasa: Large-scale simulation of every- day tasks for generalist robots","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:5045a710beb4b33d2f5dc75f049fc670c5400d5d1393d536dfab368dc08a00b6","observation_id":"e0196f78-8881-4c7c-8500-c3ea5e797624","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:00eeb66d50dc19f64ea7d2d968bb645e02ec6d6d8375c258fbc9a3f62bbeb325","observation_id":"af67b70b-605f-43af-a2eb-be79a402afcc","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"An algorithmic perspective on imitation learning.Foundations and Trends® in Robotics, 7(1-2):1–179, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:750f280548f1d04fa888efd1263e7a791edb47276ed437d1f906db783f02a466","observation_id":"6b4c56fa-6dca-4bcd-a4ed-c8e47e984339","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Imitating human behaviour with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:2c81cc9b073252bef8b33b7a43c89a21305bc83ac7756031a46622f9e5f95ce9","observation_id":"6246f3c6-6a64-4b16-8ec0-61483644de9d","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"FiLM: Visual Reasoning with a General Conditioning Layer.Proceedings of the AAAI Conference on Artificial Intelligence, 32(1), 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:43edcdb6a7a4fde1f3be6f94e8c652f38b44e44e26f56883e8c5355bb5d9a037","observation_id":"fd7f59d0-f3cf-431a-89cb-fccccef65585","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Pointnet: Deep learning on point sets for 3d classification and segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:77b0464c7ca1890741ded454dbd204af30fd6b3e36db145d28f4cd0aebc7a604","observation_id":"384a180d-f783-4514-a473-504dca5d62a0","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Compose by focus: Scene graph-based atomic skills, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:fe43f8cdbed5c0d67cd284b89c21d2ae81c9df48e69097a8d374cc9b8dd2cb22","observation_id":"8ec1beff-3808-4b27-930d-20b990b10346","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:8df6fecc4333b2e4fa10652b94d8af2fcd6f99eb169c6217cd2ee089253c6021","observation_id":"82a93e96-f370-4de6-8df4-e5bb5f1e2229","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.12920","last_updated":"2021-06-23T16:04:25Z","snapshot_observed_at":"2026-08-16T18:15:01.112401Z","submitted_at":"2021-06-23T16:04:25Z","title":"Learnt Sparsification for Interpretable Graph Neural Networks","version":1},"cited_work":{"arxiv_id":"2106.12920","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.12920","snapshot_observed_at":"2026-06-30T05:54:18.871294Z","title":"Learnt Sparsification for Inter- pretable Graph Neural Networks, 2021","venue":null,"work_id":"de9bd094-8f61-43b3-a666-ae9c0a221af3","year":2021},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"cited_paper":"/paper/2106.12920","citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:7fb492434600a4aad7167d4b278d924f6b2d46eeb9fce34431daa265d02af30f","observation_id":"b5c85c5f-32ea-4813-b263-61b14672c79c","resolution":{"observed_at":"2026-06-30T05:54:18.872796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Goal conditioned imitation learning using score- based diffusion policies","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:4d4708f93ed8100d10d204f3c28a520c72b0aa4a7670a28b23380574e4e6d23b","observation_id":"25df9204-ae93-42b2-ad3b-c142ccbadf09","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Multimodal diffusion transformer: Learn- ing versatile behavior from multimodal goals","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:3522e8476eabc2c88c318fb5c2f2138406469a91eb9209994ca4da40462c98f0","observation_id":"bf72b098-c49f-43de-8cfb-f0db5ee73187","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"FLOWER: Democratizing generalist robot policies with efficient vision- language-flow models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:3dfaede8b89d2cb494e71bd35d17901177896269e23f2c3a939e5d1076fb588a","observation_id":"9f01254b-deac-409a-8218-c9f0d8cdaf12","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Behavior transformers: Cloning kmodes with one stone.Advances in neural information processing systems, 35:22955–22968, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:5b303b66161e48a9b9fbd78d152ab4463cf9391522436b3ee295a66d389196b1","observation_id":"a2f96dc6-9e0f-4be4-9742-3aa7fa7788f7","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Graph-structured visual im- itation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:7bab27299ab174f6606fba14f29807af80fa4d2ccd4c1f45b69eb2378a7a18f0","observation_id":"1adf14ee-00ac-4fc1-a718-dc950d7e7700","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Scene graph contrastive learning for embodied navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:47dd5c4212297f6896f904be03861c7ae06c32d22ac1b7432a08170559c58e6a","observation_id":"22e24882-5261-43d0-a875-40b19a28b362","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Maximum likelihood training of score-based diffusion mod- els.Advances in neural information processing systems, 34: 1415–1428, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:3e1fab0e8ca66f2e7caf1ea5f8cadadd108b7953b810d18f32fd18f4aa132a6d","observation_id":"4bc7fd29-c079-482e-b579-20a71a8d8136","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"3d-oes: Viewpoint-invariant object-factorized environment simulators, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:7ec3167808ca4be3ba64edd7d11fd6260afbabff041849c3d314a0babcb4503c","observation_id":"84cbd9d1-bea6-4809-9a1d-0c2744a2bbad","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Attention is all you need.Advances in Neural Information Processing Systems, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:3027883b3a5e20c7627bf9e608920493ca7888fa616fbff4f3d76af826fea931","observation_id":"1e0d3153-c20c-4996-b38d-d0a44dffd3b2","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Instant policy: In- context imitation learning via graph diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:494d039ef659ee82a391af01c2f77254be14529f4d24bd4a3a9e97e2303e5ba2","observation_id":"17004caf-7514-4f87-a5a5-60235bdd39f7","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Learning to Reduce the Scale of Large Graphs: A Comprehensive Survey.ACM Trans","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:e68751b44d99f557866f9aac0b544ed0b903691c0834f61c46ef2f389988bf92","observation_id":"f33e6955-bb31-4438-9dc8-322c783b564f","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Sparse Graph Attention Networks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:09d034e8db27245ed2713e465a88751b66353c36c6f0abd76fac86d8822df1ce","observation_id":"d45eb2d9-914e-4064-8ff9-c180b35cba54","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"A Recipe for Causal Graph Regression: Confounding Effects Revisited","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:361566d80049de8df10d6c518b80cd055680e775bfd01254d2dfcb48b147a5bb","observation_id":"d0205f2a-f2ed-4591-8f6d-cdb4b7f16fbc","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Hierarchical Graph Rep- resentation Learning with Differentiable Pooling","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:a983b6142a7efe273c243b787ece1232a18fd8dc323b17be0cc43a2f2f2c759b","observation_id":"23749c68-53b9-44fe-aad2-650aa14563ba","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14260","last_updated":"2024-10-03T12:42:40Z","snapshot_observed_at":"2026-08-19T17:22:21.581703Z","submitted_at":"2024-05-23T07:40:21Z","title":"Graph Sparsification via Mixture of Graphs","version":2},"cited_work":{"arxiv_id":"2405.14260","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.14260","snapshot_observed_at":"2026-06-30T05:54:18.873901Z","title":"Graph Sparsifi- cation via Mixture of Graphs, 2024","venue":null,"work_id":"a0059fa4-d9a2-4c1c-a679-fae8e509d989","year":2024},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"cited_paper":"/paper/2405.14260","citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:4a35da4ac06b3d2ed540c474f249a06f2a5c865e1fd893b69c99c83db5e6ad77","observation_id":"cafbe76b-7262-4cd1-a623-509df866e168","resolution":{"observed_at":"2026-06-30T05:54:18.875667Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Robust Graph Representation Learning via Neural Sparsification","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:709f47d3f46c4bab6ada0ccb0b7218af390ffa014daece2ca1c88227f750b79f","observation_id":"8781467e-587f-47e3-965a-e6d8677ec18b","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.12293","last_updated":"2025-01-18T02:57:38Z","snapshot_observed_at":"2026-08-19T01:31:41.184872Z","submitted_at":"2020-09-25T15:32:31Z","title":"robosuite: A Modular Simulation Framework and Benchmark for Robot Learning","version":3},"cited_work":{"arxiv_id":"2009.12293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2009.12293","snapshot_observed_at":"2026-07-10T23:07:48.196994Z","title":"robosuite: A Modular Simulation Framework and Benchmark for Robot Learning","venue":"cs.RO","work_id":"d616d4ba-7713-4e3e-8c9e-dfebbb8f1abf","year":2020},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"cited_paper":"/paper/2009.12293","citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:1ce7c04f2d252985d6919ca18d19c6bed96c2e6bd8efbb4f9f2a2f62abd9e883","observation_id":"031c777a-2827-4045-b404-6065e66f05d3","resolution":{"observed_at":"2026-06-30T05:54:18.878489Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Hierarchical planning for long-horizon manipulation with geometric and symbolic scene graphs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:c8b287c2a525b228b102fe32741a90375b8347bfa290727cf0859b0aeb22d7fb","observation_id":"c11a3810-5e4a-4b73-876a-b848dda71803","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:580bb1c15eafde62409c3048b63dca2b52b4d29a98967640b50210aa6f121579","observation_id":"20612f87-a4d4-4662-aaa2-c3ef6448d6ad","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:f80b38facd8692164627a53e27b8595279adec035420435bf98fda2a14b5e34a","observation_id":"89c60a9f-f4b8-46c5-b169-f09389ce739f","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:50:02.529790Z","title":"How- ever, when combining Cropped-Image-Features with BB- Coordinates, we use a smaller ResNet8 backbone with an embedding dimension of 37","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:9d6a8470d33691ea28ae3f6827f9b24c83260179ebe6072d432bd93d3e67c2da","observation_id":"b9225050-7424-463e-a341-a20ce185261f","resolution":{"observed_at":"2026-06-30T05:50:02.529790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0016.2515","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:54:18.859026Z","title":"Ad- ditionally, we provide fine-grained performance metrics for Table 4","venue":null,"work_id":"61b2aabe-cf05-43c9-b487-97a107daff87","year":null},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:acd814d71d65dd51ad89a0dfde7633e0010c4d5e95280b3f3fd0c753ad8ee627","observation_id":"2ce2c075-fcc9-4f98-9da3-d3f8d4150ad3","resolution":{"observed_at":"2026-06-30T05:54:18.860640Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1925.1349","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:54:18.861830Z","title":null,"venue":null,"work_id":"e3869d53-7266-4113-b5e4-62c2316228bc","year":1925},"citing_paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T05:50:02.529790Z"},"links":{"citing_paper":"/paper/2606.30101"},"observation_digest":"sha256:176a5b2a8682b7ef1fcaf25967e058e1497c4dca8bc0c03ab5ac19dc9afd7a4d","observation_id":"4b12bf57-54ac-4f5b-8053-bcaeedc2c242","resolution":{"observed_at":"2026-06-30T05:54:18.863818Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.30101","last_updated":"2026-06-29T10:37:21Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-09T08:31:53.786213Z","submitted_at":"2026-06-29T10:37:21Z","title":"SIR: Structured Image Representations for Explainable Robot Learning"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":6,"verified_fuzzy":0},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2606.30101."}