{"as_of":"2026-08-14T03:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c34535c94ab495bf7700ca5c87895831c24f8bf3bba0f06a7a4c1632f4086d4b","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:28:15.940386Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.21547/citation-record","integrity":"/paper/2506.21547/integrity","json":"/paper/2506.21547/citation-record.json","paper":"/paper/2506.21547"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.17310","last_updated":"2024-07-25T07:47:11Z","snapshot_observed_at":"2026-08-12T23:15:36.402886Z","submitted_at":"2024-07-24T14:22:55Z","title":"LangOcc: Self-Supervised Open Vocabulary Occupancy Estimation via Volume Rendering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17310","snapshot_observed_at":"2026-08-06T22:28:10.803060Z","title":"Lan- gocc: Self-supervised open vocabulary occupancy estima- tion via volume rendering.arXiv preprint arXiv:2407.17310,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:10.803060Z"},"links":{"cited_paper":"/paper/2407.17310","citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:598c2679807a0f9afe3f5f290918952eb42574bf1e5214d248471529e7ddbedb","observation_id":"2ac381a2-7a67-4441-b1a1-e7c66b4d829c","resolution":{"observed_at":"2026-08-06T22:28:10.803060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05613","last_updated":"2023-11-09T18:59:58Z","snapshot_observed_at":"2026-08-13T05:28:53.892209Z","submitted_at":"2023-11-09T18:59:58Z","title":"Window Attention is Bugged: How not to Interpolate Position Embeddings","version":1},"cited_work":{"arxiv_id":"2311.05613","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.05613","snapshot_observed_at":"2026-08-06T22:28:16.438773Z","title":"Window Attention is Bugged: How not to Interpolate Position Embeddings","venue":"cs.CV","work_id":"cb1c5b1b-fe80-444d-81bb-5954e3ed71b6","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:10.888459Z"},"links":{"cited_paper":"/paper/2311.05613","citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:645677f87f35b0ca13eb0c2145e3f1ecb82776df62538a37a13460287048074b","observation_id":"9992915a-c8e1-4f4f-80ae-be853b1b3b11","resolution":{"observed_at":"2026-08-06T22:28:16.533009Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:27.370580Z","title":"nuscenes: A multi- modal dataset for autonomous driving","venue":null,"work_id":"2bec55d1-0280-456d-a35d-b8ca20301c3e","year":2020},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:10.975136Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:6cea4c11a109683855d1967cbf5c1c05cf21068595198f0fd8912101cafc711a","observation_id":"89010207-a54a-4a6e-8e9f-974003b12214","resolution":{"observed_at":"2026-08-06T22:29:27.387049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:27.327351Z","title":"Mopa: Multi-modal prior aided do- main adaptation for 3d semantic segmentation","venue":null,"work_id":"f090959c-d9c9-4424-b1d1-974dd2ecba41","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:11.046017Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:e1408af2151abe109ab26bc4640a39c5bf38503e2a8a5691979e8ab7a2f0024d","observation_id":"6b49c0f9-68f1-4c6e-a557-29ab62811d22","resolution":{"observed_at":"2026-08-06T22:29:27.346250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:27.285093Z","title":"Rsprompter: Learning to prompt for remote sensing instance segmenta- tion based on visual foundation model","venue":null,"work_id":"b77f34d0-cd07-4611-8439-54290ec217d9","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:11.102893Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:d1316b311926bce35a3752ae2d47d8a8d46d01cc4660d6b9c792174274f3338b","observation_id":"ad728328-d395-4920-9852-d916c8ae3c76","resolution":{"observed_at":"2026-08-06T22:29:27.303638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:27.245002Z","title":"Clip2scene: Towards label-efficient 3d scene under- standing by clip","venue":null,"work_id":"c97ca10b-79bc-43be-b6bf-c74b7cbe9a7f","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:11.222058Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:ed234aab98a351fd4ebe0efe368d9442bbf147462e9fc14e7235b401892ce375","observation_id":"c7c4142c-3c5d-44b1-85b9-54f9f2588850","resolution":{"observed_at":"2026-08-06T22:29:27.262150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04579","last_updated":"2024-08-10T11:20:52Z","snapshot_observed_at":"2026-08-12T23:06:26.489341Z","submitted_at":"2024-08-08T16:40:15Z","title":"SAM2-Adapter: Evaluating & Adapting Segment Anything 2 in Downstream Tasks: Camouflage, Shadow, Medical Image Segmentation, and More","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04579","snapshot_observed_at":"2026-08-06T22:28:11.282044Z","title":"Sam2-adapter: Evaluating & adapting seg- ment anything 2 in downstream tasks: Camouflage, shadow, medical image segmentation, and more","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:11.282044Z"},"links":{"cited_paper":"/paper/2408.04579","citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:d0c07cb3f395b95e02c4371d3bbff585b924bfad5ae1fda8a75ffbab26d68363","observation_id":"bce75e2d-29a5-48c6-990d-9a8cdbddb7e4","resolution":{"observed_at":"2026-08-06T22:28:11.282044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:27.172561Z","title":"Futr3d: A unified sensor fusion framework for 3d detection","venue":null,"work_id":"4aa34aeb-bdc8-4528-9730-1834e1160abe","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:11.358394Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:f7ef40712fe935ed840664f72f7022bcfe30f24a9ab271af15b46e16f9aec24d","observation_id":"a57b0d19-3363-47fc-9907-32a96d8e68d4","resolution":{"observed_at":"2026-08-06T22:29:27.192187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:27.122063Z","title":"Modular interactive video object segmentation: Interaction-to-mask, propagation and difference-aware fusion","venue":null,"work_id":"84eb1fc2-19ba-49b9-b9d2-9225f70a6900","year":2021},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:11.437050Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:6f71d4df4aa71b2d0b9b4ef6bc19977662246eac9bb0c8ca03811e408338173e","observation_id":"6ff831bb-075d-4614-baa4-f0b6d2a39902","resolution":{"observed_at":"2026-08-06T22:29:27.149445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:26.698440Z","title":"4d spatio-temporal convnets: Minkowski convolutional neural networks","venue":null,"work_id":"8146df2c-f98d-4fa8-adea-b6a6dba793f3","year":2019},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:11.543080Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:22ee962a39ea302d3ef8e244f9405092b79d7930748616e165f54811f4371e1f","observation_id":"05c13c22-e3f8-4399-8f0e-f50900c6da1c","resolution":{"observed_at":"2026-08-06T22:29:26.651484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:25.483953Z","title":"Benchmarking robustness of 3d object detection to common corruptions","venue":null,"work_id":"f755f6be-e5c1-4be9-8f09-d3c6397d6d5d","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:11.628577Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:717eb8651578b8c7970657bb015ed42fdf84c40b0989ae7e3fc6f00bb619689d","observation_id":"e682c806-5e8d-44e4-a89b-2d054e40b149","resolution":{"observed_at":"2026-08-06T22:28:25.874669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08206","last_updated":"2025-04-10T17:59:53Z","snapshot_observed_at":"2026-08-12T22:26:02.404114Z","submitted_at":"2024-10-10T17:59:45Z","title":"Interactive4D: Interactive 4D LiDAR Segmentation","version":2},"cited_work":{"arxiv_id":"2410.08206","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.08206","snapshot_observed_at":"2026-08-06T22:28:16.221789Z","title":"Interactive4D: Interactive 4D LiDAR Segmentation","venue":"cs.CV","work_id":"4222fa3a-cad5-46e1-998d-577229daa849","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:11.689229Z"},"links":{"cited_paper":"/paper/2410.08206","citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:1ff69792ea24b2814f15133448328d6ffdc4dba177fe7c7ff030cf041386b2b9","observation_id":"5a5a5369-4943-489d-95df-0dedf5477d85","resolution":{"observed_at":"2026-08-06T22:28:16.308866Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:25.187124Z","title":"Scale dispar- ity of instances in interactive point cloud segmentation","venue":null,"work_id":"e4d5c70c-6bc6-4c3c-b82c-5eb299d90b33","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:11.749729Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:dba8168c7d5fccad09f74e1ca7d0055d9607638cdf7419963cf9634de8a9e7d6","observation_id":"288c131c-5716-4678-a671-72ffd04b7912","resolution":{"observed_at":"2026-08-06T22:28:25.321476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:24.588608Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"6730f7bf-519c-4e21-9b83-cbe094522c29","year":2016},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:11.810505Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:b00fd4227f1cd802f01f30990a41acce9de531add5f1f40b0cbe1ad6475dad31","observation_id":"c4d0897f-45dc-4955-89aa-92352ea36eb2","resolution":{"observed_at":"2026-08-06T22:28:24.915851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:24.313967Z","title":"Segment3d: Learning fine-grained class-agnostic 3d segmentation without manual labels","venue":null,"work_id":"2880708e-0972-4b67-97fe-e46838c60d68","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:11.924255Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:65fb4b7d947dd5c3384594785d07f46f2aa542a229aaf4a0efed3ee1f2d74740","observation_id":"9ab79ba9-7ea9-4821-bdde-d809574fc80a","resolution":{"observed_at":"2026-08-06T22:28:24.417648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:24.124619Z","title":"Segment anything in high qual- ity","venue":null,"work_id":"d853311e-b23c-4766-bbdb-b7b8ffebe51b","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:12.016699Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:2182902234b4abb66a19e808667b5358a53a7e08f995c18a7235f4fc8b262a27","observation_id":"0eb6b550-77ab-43e2-bacb-b39043093dc1","resolution":{"observed_at":"2026-08-06T22:28:24.209914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:23.928980Z","title":"Segment any- thing","venue":null,"work_id":"61684f46-cbbd-4345-b80b-c8a78c6ca3d7","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:12.097005Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:2bcfb52b8efe3ae13edcbea9cf0b2925674787be08dbedd77faa51fcb74e991a","observation_id":"27d59497-94e5-47ee-b449-e591fd5d1db1","resolution":{"observed_at":"2026-08-06T22:28:24.021950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:23.736885Z","title":"Mseg3d: Multi-modal 3d semantic segmentation for autonomous driv- ing","venue":null,"work_id":"d2a6ee4b-aa1b-4334-ab7d-a78a87ca56d3","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:12.161800Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:7a8489584919d81a29c9259ced0ab0fb3e5b2a6ebddda7cd0ecee63ae30df7bd","observation_id":"b48e889b-3f05-4a1d-9e35-34e7b5d7afaa","resolution":{"observed_at":"2026-08-06T22:28:23.828327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:23.560008Z","title":"Pmafusion: Projection-based multi-modal alignment for 3d semantic oc- cupancy prediction","venue":null,"work_id":"f0f46399-da23-4eaa-b62b-92e6dbe30ea3","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:12.287159Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:d45c4cf037b38bea5e486124a30ebce238faabbbcbb409e416d767411bd1a29b","observation_id":"8e8cfae4-d57b-4452-a94a-dc2bc45c40b2","resolution":{"observed_at":"2026-08-06T22:28:23.627826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:23.398674Z","title":"Lwsis: Lidar-guided weakly super- vised instance segmentation for autonomous driving","venue":null,"work_id":"8e11a2bd-3320-483d-98e1-3e756aa9a5b3","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:12.400584Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:af2e556dbfdb3d4448031a612dff2e9b4f30e6a83b5b6b9644856ffcafd14c37","observation_id":"57ba217e-c2f3-4515-9b7b-d9f9deebdb50","resolution":{"observed_at":"2026-08-06T22:28:23.454887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:12.516765Z","title":"Unifying voxel-based representation with transformer for 3d object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:12.516765Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:677cc3eb485d84e2f7da83798211b6b014a914318ab34123d2da2ff32ac22d23","observation_id":"4852bd04-6014-4ed3-b718-1fabca8ccc35","resolution":{"observed_at":"2026-08-06T22:28:12.516765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:12.613265Z","title":"Bevfusion: A simple and robust lidar-camera fusion framework","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:12.613265Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:d1ff50f49f3ec283dab082de7e20bb0249f631b8ffed4c679b43adc212ccf626","observation_id":"3ad836e0-5447-4f84-8b78-4f13a6c2c4b3","resolution":{"observed_at":"2026-08-06T22:28:12.613265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:23.222108Z","title":"Vlm2scene: Self-supervised image-text-lidar learning with foundation models for autonomous driving scene understanding","venue":null,"work_id":"83a69387-bea2-4beb-8d33-5c30681ca0bf","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:12.691733Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:9ebbc42bd0d6fba31488aceccc35e155c6e3feeaf81182c25e9ca0d8656909fe","observation_id":"7dc72b01-e2f8-486a-93c7-5cb8c9a9fc75","resolution":{"observed_at":"2026-08-06T22:28:23.274589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:23.094681Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"df6d64c8-91fb-4ed4-b627-efd7a5ff9b69","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:12.767624Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:73089b4cf02c5689f9a7c75e9545cb5219e7dcbe136de0de3c8758e17a3e4d6f","observation_id":"69cefcba-e25b-4313-924f-7d8e5fdfcbb3","resolution":{"observed_at":"2026-08-06T22:28:23.136403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:22.877875Z","title":"Segment any point cloud sequences by distilling vision foundation models","venue":null,"work_id":"bda2f0b4-dbb6-4bcc-85a2-3b31acc14d33","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:12.816178Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:c10f6a4a1ea2f54baec8d1c4a42dd2c9129cd1f9c728a1db44440d4f806f9991","observation_id":"521ff32b-f73d-4f80-be6f-405ce9ac529f","resolution":{"observed_at":"2026-08-06T22:28:22.999539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:22.586795Z","title":"Bevfusion: Multi- task multi-sensor fusion with unified bird’s-eye view repre- sentation","venue":null,"work_id":"efd11440-1f5d-4f22-adcf-b4c2ec1e2fee","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:12.913459Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:17c89739fabb2c0be2104ed32faf329bf2e592d84cfc113cffb845322d54fa2d","observation_id":"887d42bc-bd97-46b5-a0d5-ea8e716bc9d5","resolution":{"observed_at":"2026-08-06T22:28:22.716845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:22.357967Z","title":"See more and know more: Zero- shot point cloud segmentation via multi-modal visual data","venue":null,"work_id":"a08e4894-5c95-439c-bdf9-23b39e21063d","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:12.983576Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:d297e62b257f57f11df5b2a4d914d965a010662a652e1fa1f10a6629076e971a","observation_id":"1ebe25f0-709a-47bd-bf85-0e8823cd6382","resolution":{"observed_at":"2026-08-06T22:28:22.455639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:22.103499Z","title":"Segment anything in medical images","venue":null,"work_id":"fd2335be-4115-4f3c-9973-101d213dc290","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:13.092381Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:63fbda31986c2ed855cf0f548a5bb20f393c638468f1b6451443c36057544e95","observation_id":"58779a7e-db85-41b4-87e4-46f68b9d48f5","resolution":{"observed_at":"2026-08-06T22:28:22.248901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:21.795503Z","title":"Segment anything model for medical image analysis: an experimental study","venue":null,"work_id":"99091342-a955-4167-b5d3-6477f525df40","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:13.168000Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:f6940ceece1e1d355797114e9882fdcbcb63d61a103fb6428c3280c53a36f214","observation_id":"06358cd6-5af7-4a6b-b613-7a4e03d3338e","resolution":{"observed_at":"2026-08-06T22:28:21.961123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:21.465239Z","title":"Robust 3d semantic segmentation based on multi-phase multi-modal fusion for intelligent vehicles","venue":null,"work_id":"37398f4d-06a8-4478-a087-7824ea2981d2","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:13.268755Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:39732a2dbd27805ee1577f47e89c963536132495fcfb73c6eac04ee5a6a44b30","observation_id":"c2693f9a-04ae-4461-9ac0-effec3427f74","resolution":{"observed_at":"2026-08-06T22:28:21.593696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:21.210430Z","title":"Better call sal: Towards learning to segment anything in lidar","venue":null,"work_id":"7c466c1e-5018-49e4-97bf-fa5a66dea648","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:13.329196Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:24441f72973f16bf8f49977ae1b107621b55c1d3101645f95310c9e86fba7054","observation_id":"7223ce68-41fb-4da4-9e6c-4791ad46c17f","resolution":{"observed_at":"2026-08-06T22:28:21.306518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:21.026430Z","title":"Co-occ: Coupling explicit feature fusion with volume rendering regularization for multi-modal 3d semantic occupancy prediction","venue":null,"work_id":"3bde9a67-87b3-4d04-95b2-638fcd8ab6ba","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:13.425878Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:d33b1227f5a13d1c874d2f51ac512e9f4c664574482fd1611d1bd22e7da5d661","observation_id":"00e01074-674a-4b09-88cc-8faa5e1808bc","resolution":{"observed_at":"2026-08-06T22:28:21.155493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:20.758614Z","title":"Openscene: 3d scene understanding with open vocabularies","venue":null,"work_id":"2343957c-4002-4042-811c-ab2c3e0a7054","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:13.479715Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:038e409d30932525b4eaf03d6c562bcd35861442d57eaf064d7d554fbdd821b4","observation_id":"56222498-ccbf-4815-9543-67b0663ff15d","resolution":{"observed_at":"2026-08-06T22:28:20.883231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:20.491172Z","title":"Lift, splat, shoot: Encoding images from arbitrary camera rigs by implicitly unprojecting to 3d","venue":null,"work_id":"cd458942-f3aa-4bc9-a3b2-d1a2c41853c6","year":2020},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:13.546869Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:953176524ddf65ae0f9b4725c908086f98f1d5c430b63d14f5e95f7423a9b33f","observation_id":"3b0fe05a-39b8-48ef-977e-87226489e8e4","resolution":{"observed_at":"2026-08-06T22:28:20.604570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-08-06T22:28:13.642128Z","title":"The 2017 davis challenge on video object segmentation.arXiv preprint arXiv:1704.00675, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:13.642128Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:416556c6c170a5cc5f4586cc3f49f5f0fe8ffb16587f846f14951a46191d75d2","observation_id":"95121827-8a7d-44fc-878e-3baaecc68ddd","resolution":{"observed_at":"2026-08-06T22:28:13.642128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:20.257315Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"ab641937-62db-42e4-997e-bbe76c43a789","year":2021},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:13.732489Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:6c2e03a8109db9ea4465ef9a2a5e72c1eb18ea1d05ff8627d1d26333d439ecc1","observation_id":"b3951558-4fb3-44c4-9701-ac99923d386d","resolution":{"observed_at":"2026-08-06T22:28:20.358640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-06T22:28:13.828639Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:13.828639Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:0ee7995a829010c3597dc0f70c8e4165d1a7807c7e795b3cd3211f0e3c2cd520","observation_id":"d33ec2b0-c661-4b84-9eeb-16412d686622","resolution":{"observed_at":"2026-08-06T22:28:13.828639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10300","last_updated":"2024-06-01T03:35:22Z","snapshot_observed_at":"2026-08-13T00:27:10.979145Z","submitted_at":"2024-05-16T17:54:15Z","title":"Grounding DINO 1.5: Advance the \"Edge\" of Open-Set Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10300","snapshot_observed_at":"2026-08-06T22:28:13.888243Z","title":"Grounding dino 1.5: Advance the” edge” of open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:13.888243Z"},"links":{"cited_paper":"/paper/2405.10300","citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:ceb22ae0cfb3d0188733d5282c37eabf12a6de6ae8949aaa1ca27898877e0b97","observation_id":"0ce97f8d-5518-48cb-be0c-b13437d839de","resolution":{"observed_at":"2026-08-06T22:28:13.888243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-06T22:28:13.937878Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:13.937878Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:237db17d5947d70d771a328566b4b1c19c6b36a3b8cbac99cf27652817de32e2","observation_id":"6bb1e929-f93e-46d1-a1c2-f718a3ecead6","resolution":{"observed_at":"2026-08-06T22:28:13.937878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:19.970963Z","title":"Hi- era: A hierarchical vision transformer without the bells-and- whistles","venue":null,"work_id":"08749e10-e777-4554-9592-3ab3e1309a18","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:13.996791Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:d2b0286ee834d2c2a1d27cd5fde4c8e3708ad5846dd7ed26d19b1bd89015edf5","observation_id":"04eeb661-edeb-4890-abb3-1f31f9b7038a","resolution":{"observed_at":"2026-08-06T22:28:20.124015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:19.806538Z","title":"Mm-tta: multi-modal test-time adaptation for 3d 10 semantic segmentation","venue":null,"work_id":"d1a59216-111c-4e7c-975f-d9047babf037","year":null},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:14.083889Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:83a94690bdc8659496a81e94b6f1a45c7a60eedfb27141a94e932337d277d5b2","observation_id":"fe3c8e16-b962-4f90-a250-866c14332d9d","resolution":{"observed_at":"2026-08-06T22:28:19.905563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:19.561569Z","title":"Scalability in perception for autonomous driving: Waymo open dataset","venue":null,"work_id":"00209697-54d3-4681-8e15-47f1b083121c","year":2020},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:14.198855Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:ea4721d89d64fe5b8d717f115f4120b3d23543a5877f76484bb9af7d9e7cec29","observation_id":"8e8a36f8-76dc-4376-afae-5d73055b4523","resolution":{"observed_at":"2026-08-06T22:28:19.679837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16133","last_updated":"2023-06-14T17:30:54Z","snapshot_observed_at":"2026-08-13T11:33:22.484756Z","submitted_at":"2023-05-25T15:07:25Z","title":"OVO: Open-Vocabulary Occupancy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16133","snapshot_observed_at":"2026-08-06T22:28:14.311420Z","title":"Ovo: Open-vocabulary occupancy","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:14.311420Z"},"links":{"cited_paper":"/paper/2305.16133","citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:4c8bcd317697ccfb660e0491d1dc7afbd08fd6fd6e7aaf2bde6a001ddd71086b","observation_id":"10904c99-98c2-4407-80de-7fd0d75e0fb1","resolution":{"observed_at":"2026-08-06T22:28:14.311420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:19.273079Z","title":"TorchSparse: Efficient Point Cloud Inference Engine","venue":null,"work_id":"5aa2e0d5-607e-4505-a6fa-e299a87860e8","year":2022},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:14.388928Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:a82b8984f33d1a1cfdb12bcaaeb79f42eb337169e50be388fc0ed48853a78c77","observation_id":"048dea18-c13c-43bc-889b-9508a4246db2","resolution":{"observed_at":"2026-08-06T22:28:19.394459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:19.038284Z","title":"TorchSparse++: Efficient Point Cloud Engine","venue":null,"work_id":"3666f1be-19e8-4035-b72b-35bbb7d71069","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:14.457268Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:86d1332115642ea5d0c958f9b01b36a51cfaaba4fb4b75838201f6e4ccbdfdc4","observation_id":"6d4e4b1c-5c4b-42ef-bb94-67dc322153bb","resolution":{"observed_at":"2026-08-06T22:28:19.142619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.04709","last_updated":"2023-04-11T03:53:13Z","snapshot_observed_at":"2026-08-14T01:58:48.968721Z","submitted_at":"2023-04-10T17:05:58Z","title":"Can SAM Segment Anything? When SAM Meets Camouflaged Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.04709","snapshot_observed_at":"2026-08-06T22:28:14.554591Z","title":"Can sam segment any- thing? when sam meets camouflaged object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:14.554591Z"},"links":{"cited_paper":"/paper/2304.04709","citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:89029a067377330fae3106d541d13d0b26a2147a263bc9b77c7a3b6201fe6f4c","observation_id":"2ca008ae-81d6-454e-b188-3f093be001e1","resolution":{"observed_at":"2026-08-06T22:28:14.554591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:18.744530Z","title":"Vdbfusion: Flexible and efficient tsdf integration of range sensor data","venue":null,"work_id":"efe5d83a-f1a2-49ea-adea-5dda6fc40b0f","year":2022},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:14.617828Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:9f2af89bfe120e10398ee853711bdccf3116dcd3bfe5d57fb4d0f6cc3aca3ab1","observation_id":"dd6a4028-5a97-44df-9a51-3348a75155a6","resolution":{"observed_at":"2026-08-06T22:28:18.889648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:18.458630Z","title":"Pop-3d: Open-vocabulary 3d occupancy prediction from im- ages","venue":null,"work_id":"0643e187-a8dd-45c7-96d3-a5e9b0f95756","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:14.696262Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:3e3d5009407801e485edc77fb97ea3e59c54c7da2c0da3448e56e4ffe657f8b5","observation_id":"4514438b-612b-45ce-ad7c-9f0799eaac10","resolution":{"observed_at":"2026-08-06T22:28:18.596931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:18.375752Z","title":"Occgen: Gener- ative multi-modal 3d occupancy prediction for autonomous driving","venue":null,"work_id":"efce1fff-0e8c-4c0a-978a-1cf2535aa9ab","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:14.745117Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:6703d17dd1bd18b6df3dcd130d058bdb0d6d459270dc2e61b20e9954095eaadb","observation_id":"b20dc3c7-d8d9-4ed9-837a-c7e0b4f764b8","resolution":{"observed_at":"2026-08-06T22:28:18.397216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:18.242316Z","title":"Meta- rangeseg: Lidar sequence semantic segmentation using mul- tiple feature aggregation","venue":null,"work_id":"ecd975c7-7c70-4e4d-8a15-b96fc409368d","year":2022},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:14.837250Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:9c50e3496f4c59382f9eb3a7bb88557d5c11851b0e5d1bc2fcf4ea6d8040987a","observation_id":"5117500d-1e4f-4828-9c67-3c422536abfc","resolution":{"observed_at":"2026-08-06T22:28:18.304287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:18.074488Z","title":"Lidar2map: In defense of lidar-based semantic map construction using online camera distillation","venue":null,"work_id":"6fdde540-8c60-47df-aa95-2ab15a880a46","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:14.911320Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:de8de6587d204b5bc123e7360b07136c36286afe33bf6c2fe752757020d92c3c","observation_id":"1826d538-8db4-4539-abf5-f4c4d9e65dd5","resolution":{"observed_at":"2026-08-06T22:28:18.142947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06719","last_updated":"2023-04-13T17:59:46Z","snapshot_observed_at":"2026-08-13T12:03:21.487934Z","submitted_at":"2023-04-13T17:59:46Z","title":"RoboBEV: Towards Robust Bird's Eye View Perception under Corruptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06719","snapshot_observed_at":"2026-08-06T22:28:15.020275Z","title":"Robobev: Towards robust bird’s eye view perception under corruptions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:15.020275Z"},"links":{"cited_paper":"/paper/2304.06719","citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:f4ed0a66e2f3bcfdfcdada865818874334ad159ae189e2f6840e658cd8828ba5","observation_id":"2f119ed4-54bf-4b06-a0fc-111514c14e61","resolution":{"observed_at":"2026-08-06T22:28:15.020275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:17.922721Z","title":"Sparsefusion: Fusing multi-modal sparse representations for multi-sensor 3d object detection","venue":null,"work_id":"7ac04ede-5f3e-4d6b-9ef9-be51e9b5be38","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:15.086386Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:7561987f3a3c53470d56894cbb3941396c21d6b573f0be213a12da93ef56d626","observation_id":"57ac75e5-3316-46cf-b835-ff898c2efd3b","resolution":{"observed_at":"2026-08-06T22:28:17.974967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:17.759847Z","title":"Efficientsam: Leveraged masked image pretraining for efficient segment anything","venue":null,"work_id":"537b0063-3049-43af-8125-595a2b96dbda","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:15.162663Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:66fb5e314ab45fcaea97208a48e387ce910bbece900dd0dc820a2e6a91dfbbcb","observation_id":"c45b0873-6ebf-48b1-92e7-f03a01d3cbff","resolution":{"observed_at":"2026-08-06T22:28:17.828763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:17.606739Z","title":"Cross modal trans- former: Towards fast and robust 3d object detection","venue":null,"work_id":"2e941da0-b3a3-4ff5-8d1b-5a4fa0b14858","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:15.230500Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:641bd6aaf66e40ff5c5e0be7d83bf502336225e96aa116b19b37b7eda94cae7c","observation_id":"3af955d8-7007-4b70-ab22-03a92915b5a5","resolution":{"observed_at":"2026-08-06T22:28:17.689018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03908","last_updated":"2023-06-06T17:59:51Z","snapshot_observed_at":"2026-08-13T11:23:11.804902Z","submitted_at":"2023-06-06T17:59:51Z","title":"SAM3D: Segment Anything in 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03908","snapshot_observed_at":"2026-08-06T22:28:15.313315Z","title":"Sam3d: Segment anything in 3d scenes.arXiv preprint arXiv:2306.03908, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:15.313315Z"},"links":{"cited_paper":"/paper/2306.03908","citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:6c67bb0be61598a6e9fb1ead9116eec52ab92fc63b84494828d17869dfe5ab23","observation_id":"f769896a-2525-4489-91e7-b3235d7d941f","resolution":{"observed_at":"2026-08-06T22:28:15.313315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:17.436471Z","title":"Clip2: Contrastive language- image-point pretraining from real-world point cloud data","venue":null,"work_id":"d269b992-1bd9-4078-9cc1-8ff825b0d9bf","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:15.380507Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:1ed4e5f2490a0a8b1fa97e222fb679d1101699afe618eeffccfbb354b73ccc4c","observation_id":"92380653-c9af-4de4-89df-45bdfeb533d8","resolution":{"observed_at":"2026-08-06T22:28:17.517182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14289","last_updated":"2023-07-01T07:26:22Z","snapshot_observed_at":"2026-08-12T07:11:05.316372Z","submitted_at":"2023-06-25T16:37:25Z","title":"Faster Segment Anything: Towards Lightweight SAM for Mobile Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14289","snapshot_observed_at":"2026-08-06T22:28:15.468490Z","title":"Faster segment anything: Towards lightweight sam for mo- bile applications","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:15.468490Z"},"links":{"cited_paper":"/paper/2306.14289","citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:d6d96186877667b9df7b63d54958bc15627e08fe5995d24e822d0d26e4b0ff63","observation_id":"6a9bb9de-4862-431d-b96a-c716d17ce480","resolution":{"observed_at":"2026-08-06T22:28:15.468490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:17.298415Z","title":"Sparselif: High-performance sparse lidar- camera fusion for 3d object detection","venue":null,"work_id":"806f2a6d-b57f-4725-87d1-b03de0ec0903","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:15.557301Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:5e1804723c3def2ae5b9e36fbd3b7f1253547d38adb816662a7115f0ed8ba288","observation_id":"5079f15d-3d6f-4ffa-9eb6-60410e2dbaf9","resolution":{"observed_at":"2026-08-06T22:28:17.344616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:17.137404Z","title":"Clip-fo3d: Learning free open-world 3d scene representations from 2d dense clip","venue":null,"work_id":"7bc74dec-5f1b-43af-9abc-edf8d28a433e","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:15.633085Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:54c79c121a76a397873539857858a57882a5495899183c7249a5f20ee89dd477","observation_id":"266c0635-4718-4ac9-812a-679da8aeb5ac","resolution":{"observed_at":"2026-08-06T22:28:17.210553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:16.987599Z","title":"Fusionocc: Multi-modal fusion for 3d occupancy prediction","venue":null,"work_id":"f420e64a-6318-430d-832f-c21e296315ac","year":null},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:15.697544Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:9a307a8114400c3f64db89d5c60a874d30e3ded3704410320b198c54e4c5edfa","observation_id":"8d974c38-1dd3-48e8-9b15-0dbb479abf16","resolution":{"observed_at":"2026-08-06T22:28:17.060316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12156","last_updated":"2023-06-21T10:08:29Z","snapshot_observed_at":"2026-08-13T11:12:44.426861Z","submitted_at":"2023-06-21T10:08:29Z","title":"Fast Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12156","snapshot_observed_at":"2026-08-06T22:28:15.753789Z","title":"Fast segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:15.753789Z"},"links":{"cited_paper":"/paper/2306.12156","citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:72f5e4ea8b9b49dd111d4d68887b706dbb3328e7f38ff202f1e56f945187e533","observation_id":"0f863402-eebc-4571-85b7-2e6511037a3a","resolution":{"observed_at":"2026-08-06T22:28:15.753789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:16.812962Z","title":"Veon: V ocabulary- enhanced occupancy prediction","venue":null,"work_id":"bc8d4ff3-4ba4-4267-91ca-12609398c420","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:15.851855Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:da25957939158d0669c38beb382f3ee263c1a3954a438950c8284fb0b244b68d","observation_id":"9b7be7dc-94ce-4f9c-8dad-b1f021f0db35","resolution":{"observed_at":"2026-08-06T22:28:16.897444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:16.630840Z","title":"Point-SAM: Promptable 3d segmentation model for point clouds","venue":null,"work_id":"9ea1f5e7-8e29-4e6c-9bc7-dada3d80783d","year":2025},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:15.940386Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:c9d89b629ec47bc3f439706d094130327e7cf341100584add08a9434440dc582","observation_id":"b7d79488-01cb-4ca7-9565-da8cafc064af","resolution":{"observed_at":"2026-08-06T22:28:16.708075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T14:52:32.641958Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":2,"verified_fuzzy":48},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2506.21547."}