{"as_of":"2026-08-10T20:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:34bf71300460583c4e98cc920b22f68ca3bcf0eba2c461476906fc14df151b83","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:12:19.747542Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T06:41:38.649424Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T06:45:29.442037Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2505.22429","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22429","snapshot_observed_at":"2026-07-01T06:45:29.442037Z","title":null,"venue":null,"work_id":"e5396650-8d81-4a12-bcab-15f63e4e057d","year":2025},"citing_paper":{"arxiv_id":"2606.31148","last_updated":"2026-06-30T05:21:11Z","snapshot_observed_at":"2026-07-30T15:10:27.559008Z","submitted_at":"2026-06-30T05:21:11Z","title":"PruneGround: Plug-and-play Spatial Pruning for 3D Visual Grounding","version":1},"reference_index":113,"source":"arxiv_source","source_observed_at":"2026-07-01T06:41:38.649424Z"},"links":{"cited_paper":"/paper/2505.22429","citing_paper":"/paper/2606.31148"},"observation_digest":"sha256:b392208c07466ec92471cdf3626c55f2f3e43ff7f32acc59d95938c80bb25388","observation_id":"7e135835-ad52-43f6-9e78-62ef14a3da16","resolution":{"observed_at":"2026-07-01T06:45:29.444056Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22429/citation-record","integrity":"/paper/2505.22429/integrity","json":"/paper/2505.22429/citation-record.json","paper":"/paper/2505.22429"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:33.010397Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language,","venue":null,"work_id":"343e4ed7-a99a-4bdb-88a3-ca7cdedf0283","year":2020},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:13.394174Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:a78264963976642a7baf3192e53bee3791606c7b9a0361e38907fc1880e0cc18","observation_id":"960747c0-afc7-4659-b22b-4e9984151d05","resolution":{"observed_at":"2026-08-07T13:12:33.112862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19629","last_updated":"2023-12-17T01:19:13Z","snapshot_observed_at":"2026-08-09T16:41:19.282442Z","submitted_at":"2023-10-30T15:22:50Z","title":"RayDF: Neural Ray-surface Distance Fields with Multi-view Consistency","version":2},"cited_work":{"arxiv_id":"2310.19629","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.19629","snapshot_observed_at":"2026-08-07T13:12:21.214057Z","title":"RayDF: Neural Ray-surface Distance Fields with Multi-view Consistency","venue":"cs.CV","work_id":"9966a3a6-5ef4-44cf-a9cc-872e99608147","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:13.502388Z"},"links":{"cited_paper":"/paper/2310.19629","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:566449fb91edc07d12b5745f9f58f3bb2309675998805bdca1b3da4d3d62c38f","observation_id":"8b9a2380-ea31-4728-a03e-027b0f870747","resolution":{"observed_at":"2026-08-07T13:12:21.282429Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:32.810033Z","title":"Deep view synthesis via self-consistent gen- erative network,","venue":null,"work_id":"6c0774cd-e728-4cb6-b130-d7b9518f96b4","year":2021},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:13.596606Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:7e4dc8d1b5742f9d2831ddf91141c43b26041430df4af899e796f09fe6414648","observation_id":"dbfea0d5-1991-4263-ac19-3d58190694cb","resolution":{"observed_at":"2026-08-07T13:12:32.931597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14423","last_updated":"2025-05-08T08:27:10Z","snapshot_observed_at":"2026-08-09T11:01:55.835560Z","submitted_at":"2024-11-21T18:55:23Z","title":"PhysFlow: Unleashing the Potential of Multi-modal Foundation Models and Video Diffusion for 4D Dynamic Physical Scene Simulation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14423","snapshot_observed_at":"2026-08-07T13:12:13.660944Z","title":"Unleashing the potential of multi-modal foun- dation models and video diffusion for 4d dynamic physical scene simulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:13.660944Z"},"links":{"cited_paper":"/paper/2411.14423","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:d3e49557d4fa2876b849f3dd38a62d35aeff27996cfa86bf3cbf63f3689ddb7c","observation_id":"e3b704f0-aab2-4e93-86ab-32d1e3515bac","resolution":{"observed_at":"2026-08-07T13:12:13.660944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06136","last_updated":"2025-04-26T10:11:56Z","snapshot_observed_at":"2026-08-09T11:02:14.794363Z","submitted_at":"2024-02-09T01:48:44Z","title":"SIR: Multi-view Inverse Rendering with Decomposable Shadow Under Indoor Intense Lighting","version":4},"cited_work":{"arxiv_id":"2402.06136","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.06136","snapshot_observed_at":"2026-08-07T13:12:20.968304Z","title":"SIR: Multi-view Inverse Rendering with Decomposable Shadow Under Indoor Intense Lighting","venue":"cs.CV","work_id":"5e68ffe9-f202-43ee-ab51-a3b32f14952a","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:13.744633Z"},"links":{"cited_paper":"/paper/2402.06136","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:3c6229588fdd0ca04d93b04a028d4e20a9ef962d4e0d6be36b3b34974c1120e6","observation_id":"57a6e328-f12f-4ab9-af53-7caa8174205f","resolution":{"observed_at":"2026-08-07T13:12:21.087050Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10509","last_updated":"2024-03-30T16:09:14Z","snapshot_observed_at":"2026-08-09T11:02:13.623704Z","submitted_at":"2023-08-21T06:50:29Z","title":"An Examination of the Compositionality of Large Generative Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2308.10509","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.10509","snapshot_observed_at":"2026-08-07T13:12:20.773404Z","title":"An Examination of the Compositionality of Large Generative Vision-Language Models","venue":"cs.CL","work_id":"57bb5ef8-abb5-4790-b58d-518ac2ec3ab6","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:13.802829Z"},"links":{"cited_paper":"/paper/2308.10509","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:044767d20365136d27c876724553f1170330305182b28b8a975939e9560195ae","observation_id":"4f6dd310-9524-424d-8221-e830ebea8546","resolution":{"observed_at":"2026-08-07T13:12:20.851836Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:32.639677Z","title":"Think global, act local: Dual-scale graph transformer for vision-and-language navigation,","venue":null,"work_id":"63aa49c3-e3ac-4523-ac89-577521630871","year":2022},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:13.940140Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:9f86d89a0a3d2ee4fd1edfa8b0e9533afaecb51b04450b086ac8b6130d621b3d","observation_id":"aa17f378-4420-4b33-b61d-de83946f313d","resolution":{"observed_at":"2026-08-07T13:12:32.731576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:32.488288Z","title":"Assister: Assistive navigation via condi- tional instruction generation,","venue":null,"work_id":"5c8896ab-05f2-4018-97b5-be174e122a76","year":2022},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:14.029025Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:db210898fe9a014b85ccb7f94ef4fefbda4d29fef55e696d5db0b6fe7f3b3baa","observation_id":"330b875b-8571-4c73-ae2c-62fa7c4aaeb1","resolution":{"observed_at":"2026-08-07T13:12:32.568017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13244","last_updated":"2025-02-08T15:07:56Z","snapshot_observed_at":"2026-08-09T01:01:39.308318Z","submitted_at":"2024-09-20T06:08:24Z","title":"From Cognition to Precognition: A Future-Aware Framework for Social Navigation","version":2},"cited_work":{"arxiv_id":"2409.13244","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.13244","snapshot_observed_at":"2026-08-07T13:12:20.612785Z","title":"From Cognition to Precognition: A Future-Aware Framework for Social Navigation","venue":"cs.RO","work_id":"21cc52c8-96ef-40a8-923f-9058f429d3d0","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:14.101940Z"},"links":{"cited_paper":"/paper/2409.13244","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:ac3d2bc372a1fa2a55312ebb539c2f7f904f0d9a573f2c32fd9ebea0a8543f83","observation_id":"9f53beb9-7803-4995-a8ac-6306a5f28797","resolution":{"observed_at":"2026-08-07T13:12:20.654751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:32.346422Z","title":"Clip2scene: Towards label-efficient 3d scene understanding by clip,","venue":null,"work_id":"3e948672-ee1c-4b8d-b9da-f1028e0be441","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:14.175634Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:735766694af183c36c0664751aa0a02d2eca301ee7759a005927ef6096bbaa1d","observation_id":"dd10ce10-0d22-4d89-9acd-dcdaeb9deac4","resolution":{"observed_at":"2026-08-07T13:12:32.413691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:32.181033Z","title":"Robo3d: Towards robust and reliable 3d perception against corruptions,","venue":null,"work_id":"d20ab5ce-328f-409a-bd3c-c8e3a5772374","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:14.211674Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:90e822494086896d8c3872138500c936c5383ee5304d76b498526a14ffee6019","observation_id":"31d13b7b-2b84-4766-85e6-5592b983dad8","resolution":{"observed_at":"2026-08-07T13:12:32.257194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:32.014272Z","title":"Rethinking range view representation for lidar segmentation,","venue":null,"work_id":"7d635e4f-0dd0-4835-b4a7-177f5e0a3861","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:14.269354Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:b094b7a6b2af948768febc93676f62969038987a8b1e598f40554e2b2f0695f8","observation_id":"c1d22c9f-0892-4398-8716-e2d9ccbc6a59","resolution":{"observed_at":"2026-08-07T13:12:32.093229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:31.815046Z","title":"Xvo: Generalized visual odometry via cross- modal self-training,","venue":null,"work_id":"0c8753c6-976a-4f4c-ae68-7b2d110e3cf6","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:14.340641Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:9add7a00a4b9347006d24b628ac11fafd82548e03d7888ffd9e09757bb43bd1a","observation_id":"2bedc6dc-5cfb-46f0-91a9-202261a576b1","resolution":{"observed_at":"2026-08-07T13:12:31.912696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01784","last_updated":"2022-10-08T03:42:10Z","snapshot_observed_at":"2026-08-09T11:46:37.845740Z","submitted_at":"2022-10-04T17:54:53Z","title":"COARSE3D: Class-Prototypes for Contrastive Learning in Weakly-Supervised 3D Point Cloud Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01784","snapshot_observed_at":"2026-08-07T13:12:14.416591Z","title":"Coarse3d: Class-prototypes for contrastive learning in weakly-supervised 3d point cloud segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:14.416591Z"},"links":{"cited_paper":"/paper/2210.01784","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:5221e2fdcb83ef9f92846ea662b06e1044ffb60492debc1799c69669fd8f2048","observation_id":"03bfdf04-2234-4fe5-a716-86bba0b57d4b","resolution":{"observed_at":"2026-08-07T13:12:14.416591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:31.643171Z","title":"Perception-aware multi-sensor fusion for 3d lidar semantic segmentation,","venue":null,"work_id":"59fa8c42-8dc1-4518-873e-09c56778f51d","year":2021},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:14.467600Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:ae9c03929ea608667fb09402b87663a8c191a4669841539bc3c7a72a8bb207c1","observation_id":"fa261fc4-6dda-44f3-a79d-88fba013e8b5","resolution":{"observed_at":"2026-08-07T13:12:31.722848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:31.464754Z","title":"Epmf: Efficient perception-aware multi- sensor fusion for 3d semantic segmentation,","venue":null,"work_id":"71582b1e-018d-49a2-9e45-7dded212a75c","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:14.521529Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:5194a11eb909ce8fa6277e3b0a8da9f968defcae389c76cc5c310dcc563ccb3c","observation_id":"6b23063d-3182-489e-ae81-83d3d6d434eb","resolution":{"observed_at":"2026-08-07T13:12:31.545958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:31.299345Z","title":"Tfnet: Exploiting temporal cues for fast and accurate lidar semantic segmentation,","venue":null,"work_id":"a5e0345c-dda4-426f-8b06-67e2e8fb5c01","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:14.602509Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:794e484ba53b9873375d64ad722f20cc0fefcc4cbf1c7aa22b8e7e700569cdde","observation_id":"1040d8e3-f317-4bd5-8225-322ce41fcea5","resolution":{"observed_at":"2026-08-07T13:12:31.385278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12177","last_updated":"2024-11-19T02:40:42Z","snapshot_observed_at":"2026-07-06T19:52:20.541067Z","submitted_at":"2024-11-19T02:40:42Z","title":"Robust 3D Semantic Occupancy Prediction with Calibration-free Spatial Transformation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12177","snapshot_observed_at":"2026-08-07T13:12:14.678694Z","title":"Robust 3d semantic occupancy prediction with calibration-free spatial transformation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:14.678694Z"},"links":{"cited_paper":"/paper/2411.12177","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:9423296d417ddc49f14d2314f2e9455ba234ae4a5319581bfbd5a608964270bf","observation_id":"dd2fa089-3b28-4518-a393-274e9128ad3c","resolution":{"observed_at":"2026-08-07T13:12:14.678694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:31.067294Z","title":"Dhp-mapping: A dense panoptic mapping sys- tem with hierarchical world representation and label opti- mization techniques,","venue":null,"work_id":"e3b55b00-c740-4e8b-8dd0-e7c62657a1e1","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:14.771248Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:58dcf66f5c2d5b575c3087a0c861dc7658782397fbf8264fc9aaf4ed96177ba2","observation_id":"6adcb6dd-1a21-4311-bcf5-680846d8444c","resolution":{"observed_at":"2026-08-07T13:12:31.170166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:30.864178Z","title":"Multi-modal data-efficient 3d scene un- derstanding for autonomous drivin,","venue":null,"work_id":"4b45e786-bf3a-4001-ba09-781feb459062","year":2025},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:14.854042Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:36a873383ae5f72a418fbbe42eec102ebae304bcd400b806b60a9b8437625b9e","observation_id":"dd1c1904-35de-4441-b3eb-dd532efb8937","resolution":{"observed_at":"2026-08-07T13:12:30.987688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:14.916380Z","title":"Dynamiccity: Large-scale 4d occu- pancy generation from dynamic scenes,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:14.916380Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:1fd1d20e79689e85578b24e9eb3f56e2e3cf05836222f7a017435da1b4918853","observation_id":"77efeec2-affe-46a1-8e6c-5590ca719030","resolution":{"observed_at":"2026-08-07T13:12:14.916380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:30.633341Z","title":"Calib3d: Calibrating model preferences for reliable 3d scene understanding,","venue":null,"work_id":"15c33529-3738-483b-a3f0-978f694783f4","year":1965},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:15.013655Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:c76d0bfa7ad41a3eb10fd28b33cf70970e3b2b8f123bf9b0f4a83afe9c047714","observation_id":"21947037-35b4-4109-83a4-c704eadff963","resolution":{"observed_at":"2026-08-07T13:12:30.705023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:30.443443Z","title":"Bottom up top down detection transform- ers for language grounding in images and point clouds,","venue":null,"work_id":"011c5e41-e338-4604-a8d8-0a992e88df35","year":2022},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:15.130922Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:7e2b12f9d70aca6b43bdadf5e46d6ee47ead1950c46d7cfcc3d880fd8e505ca0","observation_id":"5c6df824-f55a-43df-b72b-d33033b5e4f1","resolution":{"observed_at":"2026-08-07T13:12:30.534444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:30.227439Z","title":"3d-vista: Pre-trained transformer for 3d vision and text alignment,","venue":null,"work_id":"59cfadd7-61b1-4490-a757-0ffecc7d073d","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:15.204457Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:63d6897c4630f6fff62f9e96eaf877584d0386dbe295ca1f7fd7b342ef5dac83","observation_id":"bc2adfb0-b5bc-4cec-8761-c20b7c790c46","resolution":{"observed_at":"2026-08-07T13:12:30.315718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:30.080473Z","title":"Eda: Explicit text-decoupling and dense align- ment for 3d visual grounding,","venue":null,"work_id":"448e9e92-05c2-48e4-b996-8e78ffe35c7d","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:15.273293Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:0483b032839162eae4366f375bb94af2978607131dbbcc13c0e6d4085b5e72f5","observation_id":"7c0380bf-1754-4b5b-91dd-f9bc7301825e","resolution":{"observed_at":"2026-08-07T13:12:30.141405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:29.881196Z","title":"3dvg-transformer: Relation modeling for vi- sual grounding on point clouds,","venue":null,"work_id":"4310931d-f120-47de-96c4-78f42872b68a","year":2021},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:15.322438Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:f6a21bda4fe87eabf84dc12d9b2bb0323cce35a634b3179882c8a5e2b4c61b9b","observation_id":"d50e43f0-cf9a-41c7-b7b3-64936739d156","resolution":{"observed_at":"2026-08-07T13:12:30.002253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:29.759496Z","title":"Instancerefer: Cooperative holistic under- standing for visual grounding on point clouds through in- stance multi-level contextual referring,","venue":null,"work_id":"b8e1d6ec-c2f3-42df-b7c4-4f205d6bf946","year":2021},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:15.400260Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:971ba55f43e0a34f14f2b2ed386e883b37b06c570a6880f28d159b2f8e4adde2","observation_id":"bd712acb-4ec8-4fd0-bc3f-3c2a28ce6d8f","resolution":{"observed_at":"2026-08-07T13:12:29.817183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:29.528907Z","title":"Multi-branch collaborative learning network for 3d visual grounding,","venue":null,"work_id":"1c4a5606-bb68-4237-82c0-da6c48957ee2","year":2025},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:15.451650Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:67499a30fd3d036274da7d27c84033ae983f77bc9986e5e64df86f637c372b7a","observation_id":"f3b330c4-f015-42f9-86e6-d02a4f2ff0f9","resolution":{"observed_at":"2026-08-07T13:12:29.648448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:29.386478Z","title":"Semantickitti: A dataset for semantic scene understanding of lidar sequences,","venue":null,"work_id":"70f2aaf2-1df5-4678-b1ea-c517d705ca5b","year":2019},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:15.491354Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:138d93be05565212b00780ea5423fc8af23e04dcc9b20983369aa09e01fd5fe0","observation_id":"5f07f699-f8bc-441a-8085-dcc8ec68e53d","resolution":{"observed_at":"2026-08-07T13:12:29.457192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:29.109474Z","title":"Scalability in perception for autonomous driv- ing: Waymo open dataset,","venue":null,"work_id":"de88dd7f-c2b5-4250-b076-9bb7995928bd","year":2020},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:15.564839Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:40729b164099a23d490f209ab7f52163394a57229291fa449c7ca1f49eca500f","observation_id":"2f3a2f58-fa72-4e45-9ff5-3861b4926bab","resolution":{"observed_at":"2026-08-07T13:12:29.255587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:28.899414Z","title":"Panoptic nuscenes: A large-scale bench- mark for lidar panoptic segmentation and tracking,","venue":null,"work_id":"44c33770-6107-4051-96b9-832ce98b7514","year":2022},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:15.623601Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:e614d101526a0add60a36e77a15a2f2a22954e7fda031d236bce837b9a7c37b4","observation_id":"7354791c-6c9e-4f60-956a-af68e73e773c","resolution":{"observed_at":"2026-08-07T13:12:29.002623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:28.650386Z","title":"Visual programming for zero-shot open- vocabulary 3d visual grounding,","venue":null,"work_id":"2d7440dd-2e3a-4bc5-837b-bbbf3380475f","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:15.701053Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:e5ffadba8acd89c994299b33c30fc1553b884eb70328b88c1ccc17c156a7d835","observation_id":"11375c3b-8862-4593-bad2-7761dfc1ac0e","resolution":{"observed_at":"2026-08-07T13:12:28.773037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:28.449590Z","title":"Llm-grounder: Open-vocabulary 3d visual grounding with large language model as an agent,","venue":null,"work_id":"54519a0d-cec8-437b-ab67-5bbed6f92d0b","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:15.776796Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:0e4f5b4e0ef7ea769f434f30362417e789348a7ccac6574e085bb721b5842341","observation_id":"a012d746-72fe-44e3-bdeb-0d1aee487572","resolution":{"observed_at":"2026-08-07T13:12:28.545584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:28.168223Z","title":"Training language models to fol- low instructions with human feedback,","venue":null,"work_id":"4d6dd1f6-938b-4149-aff6-7663da807457","year":2022},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:15.878975Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:216f0b0f78a84432592534b75220d298c9e9e00a6ce7f43a99d6030585c08aae","observation_id":"c155db64-fdc3-4454-8b88-6e86c1baba4a","resolution":{"observed_at":"2026-08-07T13:12:28.325098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T13:12:15.966014Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:15.966014Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:b48f42186dac8bf281d55c17d9bbd56c353dd21afcbaa706a25862d56abd821e","observation_id":"1e1b7fb4-f508-42b6-8fab-a9bf6ea0c806","resolution":{"observed_at":"2026-08-07T13:12:15.966014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T13:12:16.033226Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.033226Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:3d6c9cee082236da7c3e2dbbad69e55c6b46ef7e129cc058c1ba4ed8abe128bd","observation_id":"3579b74e-7593-4f22-8ebb-e28f7c17fb6a","resolution":{"observed_at":"2026-08-07T13:12:16.033226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-05T11:54:14.447608Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T13:12:16.099070Z","title":"Cogvlm2: Visual language mod- els for image and video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.099070Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:87084a60dda2717d36b4fcc2256a369faeb53c6c5f6a8b80bb2627cb633298c6","observation_id":"5426ae40-e7e6-4ba6-bb60-6b115f0d2f4a","resolution":{"observed_at":"2026-08-07T13:12:16.099070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:27.965384Z","title":"Sceneverse: Scaling 3d vision-language learn- ing for grounded scene understanding,","venue":null,"work_id":"49801c0b-9ab1-4377-b4df-eb33530fdef6","year":2025},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.172492Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:c2fbe6a79bb8b1a82f79554b7e5487c55163a5c586958f19634c463c6a921096","observation_id":"63c38e4a-105a-4267-8616-ce139f488a22","resolution":{"observed_at":"2026-08-07T13:12:28.062525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04383","last_updated":"2025-05-29T14:14:03Z","snapshot_observed_at":"2026-08-02T23:47:39.393363Z","submitted_at":"2024-12-05T17:58:43Z","title":"SeeGround: See and Ground for Zero-Shot Open-Vocabulary 3D Visual Grounding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04383","snapshot_observed_at":"2026-08-07T13:12:16.243728Z","title":"Seeground: See and ground for zero- shot open-vocabulary 3d visual grounding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.243728Z"},"links":{"cited_paper":"/paper/2412.04383","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:23613577e5f9a8368eca3bd66261982577506a6731db58299234c70c42a28c63","observation_id":"37219787-af06-4101-8af5-57e158d3730c","resolution":{"observed_at":"2026-08-07T13:12:16.243728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:27.727831Z","title":"Referit3d: Neural listeners for fine- grained 3d object identification in real-world scenes,","venue":null,"work_id":"05824762-cf46-4d68-a700-66dd37bea9f4","year":2020},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.327105Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:0011864c926d0c7896fa38c909410380159a86decb906b1c27d95389e7d5ba76","observation_id":"dd2be870-d9b6-4bae-b676-1b4ff513377a","resolution":{"observed_at":"2026-08-07T13:12:27.868411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:27.467832Z","title":"Viewrefer: Grasp the multi-view knowledge for 3d visual grounding,","venue":null,"work_id":"e71f3e34-cb13-4f08-a72b-1caca2f3097a","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.383282Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:546fb54d51715fd2a829dee99e41afacec8d6c418e9a026d0953edc0b8ef7879","observation_id":"1c3d62e2-a284-4093-9485-c07bfd12986b","resolution":{"observed_at":"2026-08-07T13:12:27.642877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:27.194767Z","title":"Multi-view transformer for 3d visual grounding,","venue":null,"work_id":"b47b72b4-3137-4184-9160-3e32b57c3aad","year":2022},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.457874Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:6ccde4d1d4cd0a130c724e5cfde4585920ccf104f4a933519a708c0c070a61f0","observation_id":"a70094c3-e7ce-4b6c-8fc8-cb4d1670b286","resolution":{"observed_at":"2026-08-07T13:12:27.299693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:27.008616Z","title":"Look around and refer: 2d synthetic se- mantics knowledge distillation for 3d visual grounding,","venue":null,"work_id":"1fa4f320-8344-4710-a985-8638713a625e","year":2022},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.537325Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:71b001034ad0c3ffde3f2a80225509334811be183f2e91c8e18ad5f95ab6b261","observation_id":"9229b3cc-9dcb-4273-9701-4f45767296f1","resolution":{"observed_at":"2026-08-07T13:12:27.103416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:26.679441Z","title":"Sat: 2d semantics assisted training for 3d visual grounding,","venue":null,"work_id":"1fd06918-56b0-4063-acdf-f6adaf1e6c58","year":2021},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.586571Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:bc54610bb5ea1a921b29c06989c48d55e8752a65471005d738312db76ff1b1e9","observation_id":"d6ce677b-b1b6-4488-b020-89df092fe040","resolution":{"observed_at":"2026-08-07T13:12:26.794171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:26.491287Z","title":"Four ways to improve verbo-visual fusion for dense 3d visual grounding,","venue":null,"work_id":"0e53bdee-eb08-40be-b3b3-a05b7929ff54","year":2025},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.657203Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:08055aefbb4a3e5acdf98d44a1f14cf1602c2832dda198a063068ef0913e1910","observation_id":"1ca3c590-6dea-4a27-874d-747b1befea47","resolution":{"observed_at":"2026-08-07T13:12:26.612752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:26.273318Z","title":"Distilling coarse-to-fine semantic matching knowledge for weakly supervised 3d visual grounding,","venue":null,"work_id":"aa6be4e7-687a-4896-af3b-dab309878fe1","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.723540Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:6a93b52db5d8401a179f8ee3ea8026816d233bc0872fe7cead2a026918666429","observation_id":"8b9e7394-52c4-4635-90bc-357d17e6ace1","resolution":{"observed_at":"2026-08-07T13:12:26.393051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:26.065650Z","title":"Unifying 3d vision-language understanding via promptable queries,","venue":null,"work_id":"ad38b879-b5d4-433f-8705-7a3a63af93f9","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.772423Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:9199d6e1622eb44e6ce6ee4c1000f975a9309f412ee046a7591e27e12f66c3f8","observation_id":"8ad91c79-521c-4f81-8bfc-9e2577bc4909","resolution":{"observed_at":"2026-08-07T13:12:26.169590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00326","last_updated":"2024-12-31T07:55:35Z","snapshot_observed_at":"2026-08-07T10:41:45.025090Z","submitted_at":"2024-12-31T07:55:35Z","title":"OVGaussian: Generalizable 3D Gaussian Segmentation with Open Vocabularies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00326","snapshot_observed_at":"2026-08-07T13:12:16.828825Z","title":"Ovgaussian: Generalizable 3d gaus- sian segmentation with open vocabularies,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.828825Z"},"links":{"cited_paper":"/paper/2501.00326","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:c00d0362626c7fe961cbea48cea64c6d05cbb403a05a434aa9ccfe9ed84c6a62","observation_id":"f858176d-4543-448f-94e2-5417467643c2","resolution":{"observed_at":"2026-08-07T13:12:16.828825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:25.871546Z","title":"Multi-space alignments towards universal lidar segmentation,","venue":null,"work_id":"4787de41-bdb3-4c8f-8e1e-92fcdbb242df","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.895168Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:1c9a1d9a26cd3d8c297fda662931cb650d5497906e34a346dc45ff1f023ccdbb","observation_id":"b52141f5-02d0-4ff5-8e29-8998abfa1c46","resolution":{"observed_at":"2026-08-07T13:12:25.960756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:25.628803Z","title":"Towards label-free scene understanding by vision foundation models,","venue":null,"work_id":"9cff2eff-c634-49b8-856d-b94ccf6d8d77","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:16.967579Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:28a33353464b77393763b9bb3ddd5e153d92f027c6df5800666a8207e9ba17e0","observation_id":"02ec2c3f-ff86-42ff-8ffb-34b28baecacf","resolution":{"observed_at":"2026-08-07T13:12:25.756569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04004","last_updated":"2025-03-20T13:53:48Z","snapshot_observed_at":"2026-08-09T11:01:39.321850Z","submitted_at":"2025-01-07T18:59:58Z","title":"LiMoE: Mixture of LiDAR Representation Learners from Automotive Scenes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04004","snapshot_observed_at":"2026-08-07T13:12:17.070727Z","title":"Limoe: Mixture of lidar representation learners from automotive scenes,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:17.070727Z"},"links":{"cited_paper":"/paper/2501.04004","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:d9dbca7eea6eceaea832d3fd446323dbbbf53b36dde639396dd2078991893e31","observation_id":"72357686-fe9d-482c-a614-4c8e5f09b4b6","resolution":{"observed_at":"2026-08-07T13:12:17.070727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09511","last_updated":"2024-12-12T17:59:03Z","snapshot_observed_at":"2026-08-03T23:53:01.564520Z","submitted_at":"2024-12-12T17:59:03Z","title":"GEAL: Generalizable 3D Affordance Learning with Cross-Modal Consistency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09511","snapshot_observed_at":"2026-08-07T13:12:17.150193Z","title":"Geal: Generalizable 3d affordance learning with cross-modal consistency,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:17.150193Z"},"links":{"cited_paper":"/paper/2412.09511","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:0fa40ad12d365ce209b32cc4c0fd369d951ed8380948cf2a32ad3daf819e8810","observation_id":"197f289d-d06e-4527-8ea0-b7333f8cc82a","resolution":{"observed_at":"2026-08-07T13:12:17.150193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:25.367413Z","title":"Openscene: 3d scene understanding with open vocabularies,","venue":null,"work_id":"03452b1a-803e-4b24-bef5-3ec110e91aff","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:17.213896Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:e3f662e30ac7defb702afc2adededaefd285440ace239d8c448b82e6151142fb","observation_id":"030e2204-a25d-4b24-a0b4-3397826df452","resolution":{"observed_at":"2026-08-07T13:12:25.487986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:25.119209Z","title":"Lerf: Language embedded radiance fields,","venue":null,"work_id":"80a9b62b-f34e-41b9-a07f-dfbb9d17ff3e","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:17.283351Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:ae1ea43e8d9c0eadf5e56a5379348a5542666aff43896fc6b00b527e02e17ad3","observation_id":"423967c6-2e0e-4c80-bcf4-565da2f9c4d3","resolution":{"observed_at":"2026-08-07T13:12:25.225323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:24.887766Z","title":"Ovir-3d: Open-vocabulary 3d instance retrieval without training on 3d data,","venue":null,"work_id":"66c359f5-e695-4602-a50e-816a1f539d0f","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:17.343736Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:57a8d0a7c68f40d87d7109dc478a66424c4717a07cf6ee5930c447677b737e63","observation_id":"94103a13-4e1b-43a6-bbc2-ed6e9e18a290","resolution":{"observed_at":"2026-08-07T13:12:25.019581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11835","last_updated":"2024-03-18T14:47:03Z","snapshot_observed_at":"2026-07-06T17:46:20.935124Z","submitted_at":"2024-03-18T14:47:03Z","title":"Agent3D-Zero: An Agent for Zero-shot 3D Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11835","snapshot_observed_at":"2026-08-07T13:12:17.411309Z","title":"Agent3d-zero: An agent for zero-shot 3d understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:17.411309Z"},"links":{"cited_paper":"/paper/2403.11835","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:a7333cb34f89cdad0c9eb51a3d4ccf31b22a4eb48bdbfe5c434d762fb92d3a8f","observation_id":"1f8f6e63-38ef-47e1-98da-a0ea5409aeeb","resolution":{"observed_at":"2026-08-07T13:12:17.411309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:24.675578Z","title":"Regionplc: Regional point-language con- trastive learning for open-world 3d scene understanding,","venue":null,"work_id":"30d54873-7d92-4347-b287-0f8be773031e","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:17.470353Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:855b3c4e0b00307013b59386dd37d45bf0276fef932232e375fe499b04c976cc","observation_id":"1d2c5493-8c26-42f6-90f4-97d8c35ede01","resolution":{"observed_at":"2026-08-07T13:12:24.776061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13631","last_updated":"2023-10-29T14:04:25Z","snapshot_observed_at":"2026-08-05T15:00:57.933479Z","submitted_at":"2023-06-23T17:36:44Z","title":"OpenMask3D: Open-Vocabulary 3D Instance Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13631","snapshot_observed_at":"2026-08-07T13:12:17.523576Z","title":"Openmask3d: Open-vocabulary 3d instance segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:17.523576Z"},"links":{"cited_paper":"/paper/2306.13631","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:dae0d7db7648a493de824a9a2cbffc5934cf0668f5e1b3c63fe30ea62445fe2b","observation_id":"739b960d-0787-420d-8179-33da110aa4cf","resolution":{"observed_at":"2026-08-07T13:12:17.523576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:24.445774Z","title":"Openins3d: Snap and lookup for 3d open- vocabulary instance segmentation,","venue":null,"work_id":"9cc557e7-a899-47cf-8dbf-ee28a146c3f8","year":2025},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:17.579259Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:e90b0d49878ac8c8e4baf20e505750a8e3bc184e2fc4d93858f221255e84acbf","observation_id":"9fff50e1-dbfb-428b-bd79-ed7ded1e7bfd","resolution":{"observed_at":"2026-08-07T13:12:24.563327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:24.237241Z","title":"Sai3d: Segment any instance in 3d scenes,","venue":null,"work_id":"c3d25aff-4464-49b7-b5cd-245c9f50219f","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:17.637874Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:193aca69fea467557971a6b8e2461e84671b55110fc793fa5f6ee97c00b2e9b1","observation_id":"6b063554-7f08-45ac-8735-ec16104d3204","resolution":{"observed_at":"2026-08-07T13:12:24.321836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:24.028921Z","title":"Lasermix for semi-supervised lidar semantic segmentation,","venue":null,"work_id":"7aa694d2-15d9-412a-8f59-8c10e6930b7c","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:17.710770Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:a641c8b667c57cc9e65686c26eef547e30fae9f12e06f49464d55bec3c52929f","observation_id":"b8e8a98d-4d75-4d7e-859e-cbf1efa418be","resolution":{"observed_at":"2026-08-07T13:12:24.131536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:23.758611Z","title":"Segment any point cloud sequences by distilling vision foundation models,","venue":null,"work_id":"bc7f56cf-aa8c-4921-bf6f-f2ce49ee5f16","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:17.807087Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:ed81d31cdda6e4ab5d45a6de6039e50d6e69aa7e546c23b8c5c62e3851f65939","observation_id":"88a4132e-37ac-4dc3-aec5-a64dc8004e8f","resolution":{"observed_at":"2026-08-07T13:12:23.906258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:23.562227Z","title":"4d contrastive superflows are dense 3d repre- sentation learners,","venue":null,"work_id":"82ffc7d8-891b-4857-9fb1-603cf6637d2a","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:17.935512Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:9861994fc5ebdd0e48051f5fee9b3200a208d00e58255c1adb96e5d12ea8d593","observation_id":"c44806ef-9311-4844-9525-3cd2395c8625","resolution":{"observed_at":"2026-08-07T13:12:23.683419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:23.401474Z","title":"Frnet: Frustum-range networks for scalable lidar segmentation,","venue":null,"work_id":"ecf7f551-b4d8-4d56-8400-28980d5cc7c0","year":2025},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:18.034869Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:f361431f7095a39676a5d8de1a7e4031817a570cb157c7c39c32b452e396283d","observation_id":"1c3f78e0-9855-4610-a55d-3cdbde6b628c","resolution":{"observed_at":"2026-08-07T13:12:23.484256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-06T11:39:56.281668Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-07T13:12:18.091406Z","title":"Scene-llm: Extending language model for 3d visual understanding and reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:18.091406Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:9595f4a35b2b5262a5ab2cd3403a6d410cec49693a00c7d63e19ff3996cdb29f","observation_id":"c4b43a23-36bf-481c-ae1a-d60fab1e0d84","resolution":{"observed_at":"2026-08-07T13:12:18.091406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03026","last_updated":"2023-12-05T08:30:27Z","snapshot_observed_at":"2026-08-10T09:50:58.069095Z","submitted_at":"2023-12-05T08:30:27Z","title":"Uni3DL: Unified Model for 3D and Language Understanding","version":1},"cited_work":{"arxiv_id":"2312.03026","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.03026","snapshot_observed_at":"2026-08-07T13:12:20.057520Z","title":"Uni3DL: Unified Model for 3D and Language Understanding","venue":"cs.CV","work_id":"07ca7a2a-eeaa-4f9e-8953-635fd0f545f7","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:18.156553Z"},"links":{"cited_paper":"/paper/2312.03026","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:64f7dc99b6abcf913b9fbd02f40fd776530d6712a191be196b62a2cb07f127d4","observation_id":"b469ac04-b778-4bfe-b0ae-85bc252010b2","resolution":{"observed_at":"2026-08-07T13:12:20.164538Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:23.225567Z","title":"Conceptfusion: Open-set multi- modal 3d mapping,","venue":null,"work_id":"a98616ea-1eec-45d5-893b-9db275fc9750","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:18.254570Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:a1d3025f5ec8ffeaa7828a01fe208cd7869904a7b58b8462800c7bf17936d4dc","observation_id":"6171bf57-8155-4ef5-bc3d-97e28edb525c","resolution":{"observed_at":"2026-08-07T13:12:23.283686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-07T21:46:26.659801Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12286","snapshot_observed_at":"2026-08-07T13:12:18.478933Z","title":"Glover: Generalizable open-vocabulary affor- dance reasoning for task-oriented grasping,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:18.478933Z"},"links":{"cited_paper":"/paper/2411.12286","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:ecff285ed778b5c5cfc6a123b0272f13c13bd9892e0b6b619b44043becade6d9","observation_id":"b1e0260d-814e-4607-846a-a2b4f28ac11a","resolution":{"observed_at":"2026-08-07T13:12:18.478933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:23.075189Z","title":"Interactive planning using large language models for partially observable robotic tasks,","venue":null,"work_id":"f6e1d640-750b-452e-a989-200ff863c3df","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:18.706597Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:db914407775a4de669e6221e5dcac88b63215eb415beb01474cd96c6d65faf62","observation_id":"11fb35db-9415-452a-8a43-1742b926fdb6","resolution":{"observed_at":"2026-08-07T13:12:23.161734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:22.871807Z","title":"3d-llm: Injecting the 3d world into large language models,","venue":null,"work_id":"675bafba-bd61-4c02-b2b8-4ca5ee249126","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:18.817427Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:89ebb2b1281bc75693b8b06c91efacf380409d909f42414aa6c686a08c02f1e5","observation_id":"fce09665-8e57-4ecf-ac78-7d026fcc53c8","resolution":{"observed_at":"2026-08-07T13:12:22.964761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:22.652958Z","title":"Is your lidar placement optimized for 3d scene understanding?,","venue":null,"work_id":"0fd59884-059c-4673-b467-46edcfb7e950","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:18.907550Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:9126c1c77fcc248cdd8f031d42bc3d263e031e813e41e5771eb20588b29c95ba","observation_id":"5fcd2776-fd95-49b2-b879-6e63ed38e8fd","resolution":{"observed_at":"2026-08-07T13:12:22.736693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:22.475670Z","title":"G3-lq: Marrying hyperbolic alignment with explicit semantic-geometric modeling for 3d visual ground- ing,","venue":null,"work_id":"fb51bc0f-0df5-44a1-89cc-fb11d7ed186b","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:18.980280Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:c8d3b29a762766046557875f397b8bf8128207773fff93f5ab5571045791bf35","observation_id":"7343377b-7b76-4d17-b048-d0c15d351101","resolution":{"observed_at":"2026-08-07T13:12:22.557138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:22.214093Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"3dd439a4-d5b9-47f7-bdd1-fa2926692f45","year":2021},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:19.127295Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:5912a536d1b259d44eb6e34593d9e75d7b65ed12a6e3cf57d7b242f46047bd5b","observation_id":"3f863d07-94ef-4de9-ad28-d001bf53d84e","resolution":{"observed_at":"2026-08-07T13:12:22.328649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13860","last_updated":"2024-10-17T17:59:55Z","snapshot_observed_at":"2026-07-06T19:35:30.732080Z","submitted_at":"2024-10-17T17:59:55Z","title":"VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13860","snapshot_observed_at":"2026-08-07T13:12:19.231195Z","title":"Vlm-grounder: A vlm agent for zero-shot 3d visual grounding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:19.231195Z"},"links":{"cited_paper":"/paper/2410.13860","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:2c6b06490a861ea8cf42ac706fb9a60241345dbd45e7284dbe2313b50f8f437c","observation_id":"edcfabd1-07f9-4cd5-b156-2823a5aa0bc2","resolution":{"observed_at":"2026-08-07T13:12:19.231195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:21.997571Z","title":"Text-guided graph neural networks for referring 3d instance segmentation,","venue":null,"work_id":"c5e9423a-d617-41d7-87fe-b6d5edc15806","year":2021},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:19.353586Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:44365a9b279414f3cf853b7b538daf41940fbd9227f2a61071007537026ab595","observation_id":"6bb7d6ca-a924-4237-8f5e-d5f833206cbb","resolution":{"observed_at":"2026-08-07T13:12:22.080070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:21.756032Z","title":"Mikasa: Multi-key-anchor & scene- aware transformer for 3d visual grounding,","venue":null,"work_id":"89971deb-0fa1-446c-8f5a-c79a0d30f29a","year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:19.499102Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:4674b5c676997da357c43d3877212355946f8b4e86fc1dc74cbde528f2e9e7b8","observation_id":"4761a55c-7a2e-4aa9-9ef1-8cf0368ce164","resolution":{"observed_at":"2026-08-07T13:12:21.837968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:21.607017Z","title":"Language conditioned spatial relation rea- soning for 3d object grounding,","venue":null,"work_id":"52556197-03e1-4597-b08d-52050948668d","year":2022},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:19.626429Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:c987da705b79326ad8d3eab6ba0a96bb7849b8f282f8c5ff2fcddbf95b7d4354","observation_id":"0de609bf-af3c-4a3d-b24c-fc6057d60b72","resolution":{"observed_at":"2026-08-07T13:12:21.636127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:21.405272Z","title":"Mask3d: Mask transformer for 3d semantic instance segmentation,","venue":null,"work_id":"7131eaa7-4b07-4dc8-a24c-4ab5d9a6a46a","year":2023},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:19.747542Z"},"links":{"citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:2b9a3fde4790a031b8a3835eb96903980855e1d511c7b6f58e7bd77137ae7d11","observation_id":"b9c59bea-69c3-4075-8a2c-08946499f3a6","resolution":{"observed_at":"2026-08-07T13:12:21.510030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T05:44:30.107796Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":5,"verified_fuzzy":57},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 1 inbound Pith citation observation for arXiv:2505.22429."}