{"as_of":"2026-08-19T22:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0e16adfab3e863d8e87018a55e119c56114d94567cddb217877b601966e9f1c2","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T23:32:13.335331Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.02449/citation-record","integrity":"/paper/2412.02449/integrity","json":"/paper/2412.02449/citation-record.json","paper":"/paper/2412.02449"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:14.038067Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collab- oration 0,","venue":null,"work_id":"5d55470a-8d2b-40f2-86d5-401b2a197f0a","year":2024},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.091586Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:1aba5adcdad606e67fd8f521854aa04e9f70bd9c6b6f5936ace3e588a17c250d","observation_id":"63a0e451-30d4-42b3-9d0d-e132025f7735","resolution":{"observed_at":"2026-08-11T23:32:14.042775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:14.024246Z","title":"Co-fusion: Real-time segmentation, tracking and fusion of multiple objects,","venue":null,"work_id":"4432614a-5a7e-456c-8e57-10658d484b2b","year":2017},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.097200Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:31ec6bb43b100e4786df6fd04ca47e8b66449fd991e8c5a191fedb825682c022","observation_id":"afbb85dc-c3fe-49f3-9280-cbed1e007a00","resolution":{"observed_at":"2026-08-11T23:32:14.028709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:14.009222Z","title":"Dynaslam: Tracking, mapping, and inpainting in dynamic scenes,","venue":null,"work_id":"8869161c-ee2c-47fc-846b-977a0b8fba7e","year":2018},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.101886Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:dcda70dc1f8094f40140af5a708920326c5887558482bc5ab8b0133966c952c7","observation_id":"2bafc6da-173d-42bc-bca1-b82b6a1dc95f","resolution":{"observed_at":"2026-08-11T23:32:14.014228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.986555Z","title":"Ds- slam: A semantic visual slam towards dynamic environments,","venue":null,"work_id":"c807ab0f-3bfb-4e98-b1de-587e97aa764d","year":2018},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.107071Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:5811d8222d8fa1ff1e30398b965d9873e0344b26370b623ef91c5ef0c660b2a9","observation_id":"4041a1b1-148c-456a-9adc-e1c9bd03fdcc","resolution":{"observed_at":"2026-08-11T23:32:13.995239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.970508Z","title":"Mid-fusion: Octree-based object-level multi-instance dynamic slam,","venue":null,"work_id":"3fc9f873-fa4f-4702-a7ad-1ec866039b1e","year":2019},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.113607Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:4649fca1b9a41cbd05c4ded893a393dcc19ac95fa237e5fc6fa67497e0d2db81","observation_id":"06b08896-bda0-4fb3-898f-510d254bac47","resolution":{"observed_at":"2026-08-11T23:32:13.975796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.953718Z","title":"Objects can move: 3d change detection by geometric transformation consistency,","venue":null,"work_id":"95746705-1f8a-45a9-bd95-80c751ade177","year":2022},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.119009Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:00e7b84b0ca582a5195ec6dfd434a992db0691de23ae6d77455b9d794b4d86a0","observation_id":"fad1299a-b2be-404e-b5f4-639763bb3f7d","resolution":{"observed_at":"2026-08-11T23:32:13.958781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01148","last_updated":"2023-12-02T14:30:23Z","snapshot_observed_at":"2026-08-19T20:50:15.805052Z","submitted_at":"2023-12-02T14:30:23Z","title":"Has Anything Changed? 3D Change Detection by 2D Segmentation Masks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01148","snapshot_observed_at":"2026-08-11T23:32:13.124596Z","title":"Has anything changed? 3d change detection by 2d segmentation masks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.124596Z"},"links":{"cited_paper":"/paper/2312.01148","citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:b27cad646e46109e75bf548a4d1473bd3288fddf355259cb8d2768cdd8112df7","observation_id":"baa06743-5af7-432f-ba5e-fe04883a0139","resolution":{"observed_at":"2026-08-11T23:32:13.124596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.938966Z","title":"Living scenes: Multi- object relocalization and reconstruction in changing 3d environments,","venue":null,"work_id":"8f6dd377-ed35-4e0f-a954-c560e42f2003","year":2024},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.129936Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:994c26c708dbfd6c077fe5d66362bbfa12c5f57dde075d37553d1d710c6d4279","observation_id":"dab6bfd8-b35d-474c-a6d2-8e3d65be6df2","resolution":{"observed_at":"2026-08-11T23:32:13.943434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03012","last_updated":"2015-12-09T19:42:48Z","snapshot_observed_at":"2026-08-15T22:26:43.274625Z","submitted_at":"2015-12-09T19:42:48Z","title":"ShapeNet: An Information-Rich 3D Model Repository","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03012","snapshot_observed_at":"2026-08-11T23:32:13.135539Z","title":"Shapenet: An information- rich 3d model repository,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.135539Z"},"links":{"cited_paper":"/paper/1512.03012","citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:950ad655172f2b2e863fcded8295145d91ddd35c6ef0608810d2f2b1e86de8b0","observation_id":"c8204d9f-aa53-44eb-8d88-94009103d94c","resolution":{"observed_at":"2026-08-11T23:32:13.135539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.141207Z","title":"Langsplat: 3d language gaussian splatting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.141207Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:ccb77967e6971be9f302da80cfb6cc20c361675088249fae5df379493fc1aeec","observation_id":"95318ce9-b0e8-46f7-9690-f0cd3b655e68","resolution":{"observed_at":"2026-08-11T23:32:13.141207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.145646Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.145646Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:539730c1a53eb7e2b8939bcbe99b5aeb8b57b7718fd9d16632c5aba55d834beb","observation_id":"e0b0454d-e12b-4d38-b246-3c26f0c9e016","resolution":{"observed_at":"2026-08-11T23:32:13.145646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05474","last_updated":"2022-08-26T17:12:17Z","snapshot_observed_at":"2026-08-14T05:42:22.751765Z","submitted_at":"2017-12-14T23:17:24Z","title":"AI2-THOR: An Interactive 3D Environment for Visual AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05474","snapshot_observed_at":"2026-08-11T23:32:13.149398Z","title":"Ai2-thor: An interactive 3d environment for visual ai,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.149398Z"},"links":{"cited_paper":"/paper/1712.05474","citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:e0aa15e6682b62af3caab8f2f5f33d7e8e67de13c686f38c0172fc755bf59047","observation_id":"765bf078-6c0e-4aeb-8ca6-43bfc85cbba4","resolution":{"observed_at":"2026-08-11T23:32:13.149398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.155028Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.155028Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:e88999c5e15ae77cef793bf3695a95313d69d91c458ac6d39cb6acb4b00aa2e4","observation_id":"b4ef147f-f76b-4167-8068-9fff7a7537d2","resolution":{"observed_at":"2026-08-11T23:32:13.155028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.900594Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip,","venue":null,"work_id":"74758545-c433-485e-b1da-67b9b35ede2f","year":2023},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.161292Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:c2fed77f3b4df028bc0c4278a74c9aa0d8d95d39f3cf0bfbb5eb1dff5946a357","observation_id":"64a9368a-650a-450b-9338-8de814e76ee6","resolution":{"observed_at":"2026-08-11T23:32:13.905656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.165243Z","title":"Scaling open-vocabulary image segmentation with image-level labels,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.165243Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:91e209b758b8bb4cc06d3d1820e9b04644381f3791dfc7e4723f667891e002de","observation_id":"2964ff3b-b419-4e5b-8a7f-f98525aaa127","resolution":{"observed_at":"2026-08-11T23:32:13.165243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.866590Z","title":"Lm-nav: Robotic navigation with large pre-trained models of language, vision, and action,","venue":null,"work_id":"04ef552f-8e16-4116-9467-51e56f5a1beb","year":2023},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.169021Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:27581b893965f7bae3b7487850052432f40ee7c651fd711b5945cc0a2801a61b","observation_id":"9ba93c6a-fcb1-44b8-bc81-34b3c4597bbe","resolution":{"observed_at":"2026-08-11T23:32:13.872160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.172919Z","title":"Visual language maps for robot navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.172919Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:938b57b66ea9d9d596e544ac53645a522586e972c62294cd20cffc767789cb6b","observation_id":"439c5779-8b29-4af4-808e-e030dbfa5a60","resolution":{"observed_at":"2026-08-11T23:32:13.172919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.176757Z","title":"Concept- graphs: Open-vocabulary 3d scene graphs for perception and planning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.176757Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:1dd0a59d369453e23db2495b277155a5eebc9c1264f6a40bbef5992011c65e91","observation_id":"7b339340-4fee-4882-9d85-da4522d85908","resolution":{"observed_at":"2026-08-11T23:32:13.176757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.833933Z","title":"Audio visual language maps for robot navigation,","venue":null,"work_id":"61d5c526-5b80-45f6-bc5e-4631ce4dbdb6","year":2023},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.181350Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:471e35a7024be7dd9d02347bcf6ca3b381d8075b1be975ff32174dfbc1633cf3","observation_id":"c420878f-1e81-44f7-bffa-07e870912746","resolution":{"observed_at":"2026-08-11T23:32:13.838996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.815838Z","title":"Hi- erarchical Open-V ocabulary 3D Scene Graphs for Language-Grounded Robot Navigation,","venue":null,"work_id":"afab6c7c-75e1-4eba-bf8e-67980b258b7c","year":2024},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.185580Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:18ba8909e98225fac7240fca8188ef0b78c9f7591f6aad192ec4be335db52a59","observation_id":"5f718421-d151-4d68-9454-9178d5d56ab0","resolution":{"observed_at":"2026-08-11T23:32:13.824551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05973","last_updated":"2023-11-02T06:53:37Z","snapshot_observed_at":"2026-08-05T01:03:23.456778Z","submitted_at":"2023-07-12T07:40:48Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05973","snapshot_observed_at":"2026-08-11T23:32:13.190124Z","title":"V oxposer: Composable 3d value maps for robotic manipulation with language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.190124Z"},"links":{"cited_paper":"/paper/2307.05973","citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:2f7d4ada36a7043ff2d4fa7cc479246eded11f9aa253b95a07c8c556be48a184","observation_id":"1809c5eb-8241-4806-872f-262354a83f35","resolution":{"observed_at":"2026-08-11T23:32:13.190124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.198215Z","title":"Lerf: Language embedded radiance fields,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.198215Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:51d40d58e068999e1bc909ba30ca9a7305baae706efbfe856c9b59aad067f568","observation_id":"27c8e546-d2c4-4912-9776-e847671b14f6","resolution":{"observed_at":"2026-08-11T23:32:13.198215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.203121Z","title":"Openscene: 3d scene understanding with open vocabularies,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.203121Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:4e4c56f76eb34c25e404d3ef3589af120f64c7d5534f6ba7f909ddada1eeb61d","observation_id":"ffbb8614-d555-41be-b760-3a9ac5c892d8","resolution":{"observed_at":"2026-08-11T23:32:13.203121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.780761Z","title":"Conceptfusion: Open-set multimodal 3d mapping,","venue":null,"work_id":"522643d4-66d3-4340-881c-f2ceb47e9733","year":2023},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.207483Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:79419701e37733430a447e346e14cd1c362031e5ad7b45fefe99e12b878adfd0","observation_id":"e9d7eacb-eab9-4702-8d6e-b11e84d5a383","resolution":{"observed_at":"2026-08-11T23:32:13.786631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.766583Z","title":"OpenNeRF: Open Set 3D Neural Scene Segmentation with Pixel-Wise Features and Rendered Novel Views,","venue":null,"work_id":"4691d677-8bcb-4022-8d97-ca05c791d4b5","year":2024},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.213484Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:2b53fcd0b37f298bd48ca91c5ae1d650715a3650588c8cb652dd069c1c534f02","observation_id":"35be9845-8a8a-401e-9e63-a95bde7f0300","resolution":{"observed_at":"2026-08-11T23:32:13.771773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.750883Z","title":"Garfield: Group anything with radiance fields,","venue":null,"work_id":"4f3a2398-9c29-431f-8b20-68dff7efa484","year":2024},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.218672Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:9e898f07589a43d99c6022b2c8e3615305b21ff51f836bdfcc7566f0c96230c4","observation_id":"a559fa3c-4d48-4c84-82c1-4466433814ee","resolution":{"observed_at":"2026-08-11T23:32:13.756850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.224044Z","title":"Fusion++: V olumetric object-level slam,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.224044Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:94aaf053d16aba594062b64f988b3c974e923221a5573bbcda8311624604656d","observation_id":"1eb93b9d-673a-4385-89d9-b9ef689370ba","resolution":{"observed_at":"2026-08-11T23:32:13.224044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.727436Z","title":"Flowfusion: Dynamic dense rgb-d slam based on optical flow,","venue":null,"work_id":"74a92cc5-1ba1-4ab6-88c9-bf8d92944164","year":2020},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.230270Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:44dd76b15b0a78669daaa80837d6076fba19e89417f18f564191d88ad30ed2f7","observation_id":"57a668ed-5bcb-497d-8841-4c8dcf87b078","resolution":{"observed_at":"2026-08-11T23:32:13.731802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.238230Z","title":"Dynamicfusion: Recon- struction and tracking of non-rigid scenes in real-time,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.238230Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:a59eb9034295f9ef6153443d5a91825d7c79ed17b7ca25171b0b7bcffd51965d","observation_id":"3df8035b-8b58-4d7b-885c-4d5ddc6b8f35","resolution":{"observed_at":"2026-08-11T23:32:13.238230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09713","last_updated":"2023-08-18T17:59:21Z","snapshot_observed_at":"2026-08-18T20:49:19.983135Z","submitted_at":"2023-08-18T17:59:21Z","title":"Dynamic 3D Gaussians: Tracking by Persistent Dynamic View Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09713","snapshot_observed_at":"2026-08-11T23:32:13.243246Z","title":"Dynamic 3d gaus- sians: Tracking by persistent dynamic view synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.243246Z"},"links":{"cited_paper":"/paper/2308.09713","citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:697ba15516587179e513661db8ba50ee426f80c74999c71a1b9e691837029995","observation_id":"a3a27249-7698-4e33-95df-305aed749121","resolution":{"observed_at":"2026-08-11T23:32:13.243246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.248309Z","title":"Phys- gaussian: Physics-integrated 3d gaussians for generative dynamics,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.248309Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:264318cd99b8aa8d9026f1eb7d4cb340c6a919efd0646ffac80c5d51d4c34b75","observation_id":"99faa44f-af0f-415f-84f8-bb2e6d464044","resolution":{"observed_at":"2026-08-11T23:32:13.248309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.697996Z","title":"Robust change detection based on neural descriptor fields,","venue":null,"work_id":"3907a8f7-e10f-435c-a570-219fcdb89616","year":2022},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.253625Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:b0b64fe8625cb996be75efff40da62000bbc5562b5cc384acb6b05b250e366d4","observation_id":"30ac95d4-47d0-411c-836c-319fa030d368","resolution":{"observed_at":"2026-08-11T23:32:13.702193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.683827Z","title":"Indoor scene change captioning based on multimodality data,","venue":null,"work_id":"9ebfad36-f540-4d8a-b713-f06898a61504","year":2020},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.258817Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:0ec8acbf21a052ef1e7893e14bd4d8d4e048accdd5d4284284f7011a6d9bd890","observation_id":"cfb1d430-e2f6-4a68-a7e8-1adc6cb44f67","resolution":{"observed_at":"2026-08-11T23:32:13.688263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.669003Z","title":"3d vsg: Long-term semantic scene change prediction through 3d variable scene graphs,","venue":null,"work_id":"9b452130-c455-4c11-976e-01199b5280c5","year":2023},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.263167Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:d767f7ad455b0b0fc4dff9fbbd1b36b604042f77d0792a2cf7e7bbdf43f0f3c8","observation_id":"ac1a302f-09cc-4f36-bdde-e710e62249bc","resolution":{"observed_at":"2026-08-11T23:32:13.673705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.651756Z","title":"Khronos: A unified approach for spatio-temporal metric-semantic slam in dynamic envi- ronments,","venue":null,"work_id":"6ead7e9f-26c1-47ae-9339-7741d4380947","year":2024},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.267297Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:9aeab5faa055d9643d6bdd31d328ba09dba4b7e318e1a9dd18a3a03ade312acb","observation_id":"3b5d5cd5-89d5-46ed-8c56-db09ad8b336f","resolution":{"observed_at":"2026-08-11T23:32:13.656947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.271806Z","title":"Pointnet: Deep learning on point sets for 3d classification and segmentation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.271806Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:efddefc1072c4fec263ffd3adcafe97e44c5d8a4e62ade023215ebe37363dc8d","observation_id":"86aac150-5a4f-4280-935f-7571f66c5d2a","resolution":{"observed_at":"2026-08-11T23:32:13.271806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.276592Z","title":"Dynamic graph cnn for learning on point clouds,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.276592Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:7566f4519b9bc5779cc34c7a480c071732e081f1e4efa1933bed56f283663389","observation_id":"017a2e74-7a4f-4eac-b1d2-5900b581b3c7","resolution":{"observed_at":"2026-08-11T23:32:13.276592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.281329Z","title":"Deepsdf: Learning continuous signed distance functions for shape rep- resentation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.281329Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:2c2c7afdbd16ec2d150b9439273c38f0dd440f95225e106a76635441911b76ff","observation_id":"805449d7-21ae-427c-a8f8-b75971ffc70b","resolution":{"observed_at":"2026-08-11T23:32:13.281329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.611303Z","title":"Learning implicit fields for generative shape modeling,","venue":null,"work_id":"58c9c4d0-7a74-4502-b9da-9b81d4b09f9f","year":2019},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.285586Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:d0db69c347e2c7a4b9b72cdab514c26784fadc81159842e84bbbf3f165706e4b","observation_id":"00e35557-44b7-4be1-bc62-9e8456937ac3","resolution":{"observed_at":"2026-08-11T23:32:13.616317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.594903Z","title":"Coarse- to-fine point cloud registration with se (3)-equivariant representations,","venue":null,"work_id":"8f101a48-8c94-4388-ada2-e9cae48264a2","year":2023},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.290295Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:0daa72fdbd63d2eaa74fc919799168c6d2eacce2b4c3f1286d05a2301e99938a","observation_id":"9f396d5b-17b1-41d4-bd96-269a688417fb","resolution":{"observed_at":"2026-08-11T23:32:13.600121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.579610Z","title":"Neural descriptor fields: Se (3)-equivariant object representations for manipulation,","venue":null,"work_id":"0a2b6d89-0a9d-4f64-b0c3-c3ea69e25c3b","year":2022},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.294483Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:39ed992e8f52d796beb66def31cec12347cb8def50157ffa9eb4b2261feaf8f0","observation_id":"a805f033-bb08-4c43-9c22-e21667bf83c8","resolution":{"observed_at":"2026-08-11T23:32:13.585060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.555146Z","title":"Neuse: Neural se (3)-equivariant embedding for consistent spatial understanding with objects,","venue":null,"work_id":"aceacbb6-3c5d-47d8-9269-28d52f2cfcbb","year":2023},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.298642Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:90fe3921c74d1ede2339bd7044b4b550d7909beda6146507f84fcdf74fd2b85c","observation_id":"cc8d1dbe-e030-4d07-b69c-f329d434b359","resolution":{"observed_at":"2026-08-11T23:32:13.565279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.302483Z","title":"A simple framework for contrastive learning of visual representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.302483Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:7cfd263e6e9a77f1d14a9d0ff61a3ec43617fe9dd2cdfc019bce694c7c206548","observation_id":"e040f418-5466-4e8a-9444-d62b381760c6","resolution":{"observed_at":"2026-08-11T23:32:13.302483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.306948Z","title":"Pointnet++: Deep hierarchical feature learning on point sets in a metric space,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.306948Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:0311f0bbb3f0583ff43383571c7fc3b8c86279649d05bb6fd2e7105f29576428","observation_id":"31892ba7-4f42-4f00-b6a1-b4aba30e6771","resolution":{"observed_at":"2026-08-11T23:32:13.306948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.312140Z","title":"Improved deep metric learning with multi-class n-pair loss objective,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.312140Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:3f1f132f354a9025e5f91b7c30528f63cea9f78f4543f1397e9b349997efaae3","observation_id":"31df61c9-33d7-4071-8aa2-b9248b3a08e8","resolution":{"observed_at":"2026-08-11T23:32:13.312140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-11T23:32:13.316162Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.316162Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:5dd493d775a5b06056b0c23566fe55c303295a43ca38d41f0c0d0055bce546ad","observation_id":"cfc74011-9cce-473f-a1d9-cfd2579ac7e7","resolution":{"observed_at":"2026-08-11T23:32:13.316162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.512653Z","title":"Language-driven semantic segmentation,","venue":null,"work_id":"c5c94e07-1fdb-4c09-98e5-caa0fa0841fe","year":2022},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.320757Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:0aef2e9d1c8491da66d0ca34206e31e1d456ea1c277d6b09c81c15e8bc5ef7c0","observation_id":"82d38ed5-c79e-4e1c-b881-c8682508ee9c","resolution":{"observed_at":"2026-08-11T23:32:13.517764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.493733Z","title":"Density-based spatial clustering of applications with noise,","venue":null,"work_id":"12f77187-2cfc-44f6-b4f7-82fb2a03c587","year":1996},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.325424Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:4d9a5a188f0e9e4005c61b75ecac64a0cd92323fe363e9fc0dacbed7c41c6cac","observation_id":"a495c29a-5fbb-479c-a495-cd86c22a580d","resolution":{"observed_at":"2026-08-11T23:32:13.502212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-11T23:32:13.329892Z","title":"Sam 2: Segment anything in images and videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.329892Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:6dbff76c9016b2b6a01a1ae510719ea7deb1d5ccf7171b5ded307ad5a7843cb3","observation_id":"883dd30c-8aa9-4974-8b2d-2f21b063900e","resolution":{"observed_at":"2026-08-11T23:32:13.329892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:32:13.335331Z","title":"Droid-slam: Deep visual slam for monocular, stereo, and rgb-d cameras,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T23:32:13.335331Z"},"links":{"citing_paper":"/paper/2412.02449"},"observation_digest":"sha256:88dc85e73c6e2ec3f285fbe2dcaf480bc345b222d35ee70b7c6bb8db5fccb547","observation_id":"8a4c5cc3-b724-4fda-a323-f41d9b9fe4c8","resolution":{"observed_at":"2026-08-11T23:32:13.335331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.02449","last_updated":"2024-12-03T13:34:42Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-19T12:38:19.013618Z","submitted_at":"2024-12-03T13:34:42Z","title":"BYE: Build Your Encoder with One Sequence of Exploration Data for Long-Term Dynamic Scene Understanding"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2412.02449."}