{"as_of":"2026-08-20T16:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1a1d3465927605cf5272896d430625fa845130d6dc3d0b0e9f21324d0a52eceb","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:52:56.660665Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.20758/citation-record","integrity":"/paper/2508.20758/integrity","json":"/paper/2508.20758/citation-record.json","paper":"/paper/2508.20758"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.931072Z","title":"Referit3d: Neural listeners for fine-grained 3d object iden- tification in real-world scenes","venue":null,"work_id":"a7850ce0-1486-4b44-8a6e-a16abe47096b","year":2020},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.176174Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:c102800ea4a6c1f1d351879212bda2dd170e1105fcc743c114d6d741238aa9f1","observation_id":"90c3f9ba-03b2-496a-8cee-cf91dfab34da","resolution":{"observed_at":"2026-08-05T14:52:57.935911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.914424Z","title":"Tongyi Qianwen","venue":null,"work_id":"deb8bdd5-3452-4a60-98b7-8cf46beb9b42","year":2025},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.183038Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:5feb721db3b5c5c5e837c79443c5caeea72136739dc618fa5e56c2e82a6d0086","observation_id":"773e90b1-a59f-479b-be30-16b83348fe39","resolution":{"observed_at":"2026-08-05T14:52:57.919786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.898286Z","title":"VolcEngine","venue":null,"work_id":"07c2afe7-a547-4699-a83c-f8342fd4e261","year":2025},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.192047Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:3585432fde1129a329082fea523e6c7bfa791d2cad37d708dd4e294b100633f1","observation_id":"3f339379-bf52-4e75-9d59-6582480d14ba","resolution":{"observed_at":"2026-08-05T14:52:57.903152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.882086Z","title":"3djcg: A uni- fied framework for joint dense captioning and visual grounding on 3d point clouds","venue":null,"work_id":"5b449f0f-0dda-4d11-90ff-f625d7257374","year":2022},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.201622Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:16057a6bbe5f0bb4aa65d3753c8807691783b92ae830f79478d2e2b159a2e1b4","observation_id":"8cc8161b-a39b-469d-befc-5ac3e461c955","resolution":{"observed_at":"2026-08-05T14:52:57.887017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.866392Z","title":"Tparn: A network for enhancing synthetic video quality after 3d-hevc encoding","venue":null,"work_id":"2a0ba754-145e-4c2b-9d71-453fcdf58ef9","year":2024},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.210128Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:8903a338d639c1371c206c3834126604d9a368857a01e9b4311ef098b32cfd21","observation_id":"86c4682c-3d64-415e-b135-20face92b370","resolution":{"observed_at":"2026-08-05T14:52:57.871506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.850322Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":"96f44c11-06db-43a5-9f2d-fd6b439d64df","year":2020},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.216472Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:5a21737580eec105c2be13fc358dd3f32b285a6199e7029620f35f55fdb4d2bc","observation_id":"513346dc-3a1e-4b86-bc93-f09c332b1ce6","resolution":{"observed_at":"2026-08-05T14:52:57.855923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.834292Z","title":"D 3 net: A unified speaker-listener architecture for 3d dense captioning and visual grounding","venue":null,"work_id":"24162836-fbf7-4e0c-8a3d-fa95c74be725","year":2022},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.226555Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:83225da75e8c4066e2f165e69ffc555b7b709ea1492ea7cfcb70a78e35ec27ac","observation_id":"d6b8fac5-0394-460e-b024-504529bd8f8c","resolution":{"observed_at":"2026-08-05T14:52:57.839539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-17T13:04:04.064087Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-05T14:52:56.238082Z","title":"Minigpt-v2: large language model as a unified interface for vision- language multi-task learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.238082Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:ecedd621c4ca81174f3ec9ee41c89d93bdc95a1c9309541b39f7158fb7328262","observation_id":"1ce807c2-d9da-4452-939b-a032805c84fb","resolution":{"observed_at":"2026-08-05T14:52:56.238082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19326","last_updated":"2024-05-29T17:56:07Z","snapshot_observed_at":"2026-08-16T13:48:05.061996Z","submitted_at":"2024-05-29T17:56:07Z","title":"Reasoning3D -- Grounding and Reasoning in 3D: Fine-Grained Zero-Shot Open-Vocabulary 3D Reasoning Part Segmentation via Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19326","snapshot_observed_at":"2026-08-05T14:52:56.245767Z","title":"Reasoning3d–grounding and reasoning in 3d: Fine-grained zero-shot open-vocabulary 3d reasoning part segmentation via large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.245767Z"},"links":{"cited_paper":"/paper/2405.19326","citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:4e96878bf1665cb606b1a34076b4b3e5cca1a5d7ba6d27c07a87bb1b51f40006","observation_id":"cf4edee0-1018-48c8-b435-e07501aabaef","resolution":{"observed_at":"2026-08-05T14:52:56.245767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:56.252592Z","title":"Objaverse: A universe of annotated 3d objects","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.252592Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:94f5058dcf073f59d6ca404e5ef6b317e27e56e8d97e1b6738853191505b35fc","observation_id":"8fac060a-2fe1-4f9d-9273-d93698461498","resolution":{"observed_at":"2026-08-05T14:52:56.252592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.807037Z","title":"Cg-slam: Efficient dense rgb-d slam in a consistent uncertainty-aware 3d gaussian field","venue":null,"work_id":"7d3abe74-4827-47d5-adce-f65b19357461","year":2024},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.262404Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:eb42e4f8afa41fc4a63a89d87d654c80b7845cc2ff012a1195045d9fb37582c0","observation_id":"e0a5a4f8-7eea-45f5-856a-76641dbd3b81","resolution":{"observed_at":"2026-08-05T14:52:57.812375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.791166Z","title":"Photo-slam: Real- time simultaneous localization and photorealistic mapping for monocular stereo and rgb-d cameras","venue":null,"work_id":"7323edf8-a364-4016-a883-6f48a57bdd7c","year":2024},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.267935Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:32080207268a812e1a1eabe9c4377d9451ef86337b97e1f56a8bab3c0459b3d5","observation_id":"01d8a546-520b-47d5-8182-d29766833499","resolution":{"observed_at":"2026-08-05T14:52:57.796549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.775988Z","title":"Reason3d: Searching and reasoning 3d segmentation via large language model","venue":null,"work_id":"0823f1ec-4032-4f20-9804-dd0a11ec13f3","year":2025},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.276702Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:51443696128d41b6a514f45d5ed208baa61c79b85dc108e3c582a9b40fc05ae6","observation_id":"b164ceec-9a8b-452a-94bf-a3b789245cd6","resolution":{"observed_at":"2026-08-05T14:52:57.780828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.760086Z","title":"Text- guided graph neural networks for referring 3d instance segmentation","venue":null,"work_id":"e9ae077a-ccf4-4c6b-9a56-66a1473e88bb","year":2021},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.283603Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:55814333a8fce3dce555cc25dc29d634012afe4328d3156f8016d277bd19697f","observation_id":"388e6c81-4929-4e25-b219-5d4a05c7d513","resolution":{"observed_at":"2026-08-05T14:52:57.765227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.743976Z","title":"Training an open-vocabulary monocular 3d detection model without 3d data","venue":null,"work_id":"c16a13e4-502d-4a65-a376-88f13cc088ec","year":2024},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.289237Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:112f19d42316c0f26027a1323406ff5a01cbb6d7bb76fb8aac7a3a8548aa0c3b","observation_id":"9a9d2c2b-6e7b-405c-a528-531f08b8aaae","resolution":{"observed_at":"2026-08-05T14:52:57.749130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.728447Z","title":"Multi-view transformer for 3d visual grounding","venue":null,"work_id":"9bf24483-69c2-43f1-a828-3b332d245223","year":2022},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.294597Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:2574b177e3ce435b32adc663fc539f3a1d94a9315ebb4c0607754c0ce9fa00ff","observation_id":"93b08520-f1ef-42c7-bf64-9bc301848b52","resolution":{"observed_at":"2026-08-05T14:52:57.733468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.712754Z","title":"Joint semi- supervised and active learning via 3d consistency for 3d object detection","venue":null,"work_id":"811cb479-2936-4345-a5e8-0f0870ca98ef","year":2023},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.301732Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:dd8bc264e2e9f190522105ec4b000318240a19f9888e19a155c4eb9ece2cf286","observation_id":"5a956406-367b-4218-922a-06e85ec48f78","resolution":{"observed_at":"2026-08-05T14:52:57.718020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.697503Z","title":"Bottom up top down detection transformers for language grounding in images and point clouds","venue":null,"work_id":"fdf17aa2-e744-4f3d-b304-e289fa6984c2","year":2022},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.310233Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:ac1cc106510c4b98ba16cb3794f65447642217b977015cfdae1838d535c50828","observation_id":"66ee71c3-0d79-44d5-9655-744352a45a60","resolution":{"observed_at":"2026-08-05T14:52:57.702405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.680328Z","title":"Cplip: zero-shot learning for histopathology with comprehensive vision-language alignment","venue":null,"work_id":"10632b27-e608-4b9e-a7e5-e71d9d101bf9","year":2024},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.317105Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:6a5cfcba557581e45c3a6d0f5d13f4a580ae93376a9a6943bb89c2c29eb7207a","observation_id":"1d0621b7-373a-45ab-8f6c-910a28a78aab","resolution":{"observed_at":"2026-08-05T14:52:57.686013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.664423Z","title":"Pointgroup: Dual-set point grouping for 3d instance segmentation","venue":null,"work_id":"9804f2c4-6005-4296-a110-6a5f78358d1e","year":2020},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.325097Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:7ddb7e440b3d2a45b5194b684ec664a155bb321e3dad9ea12003299e8c16b5a1","observation_id":"a0e8b316-c33a-4b98-9152-b00269cf095c","resolution":{"observed_at":"2026-08-05T14:52:57.669400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.647305Z","title":"Lerf: Language embedded radiance fields","venue":null,"work_id":"0d13dc2a-5ac0-41f1-a48b-7367eb09fd72","year":2023},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.332470Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:57c1e7d7e411be9e55821497ddaf9ff752b92e83e5b40b84ee3faff4102a7c9a","observation_id":"80e8716c-c656-4190-9017-a5075da58bf1","resolution":{"observed_at":"2026-08-05T14:52:57.652889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.628416Z","title":"Rgb-d based visual slam algorithm for indoor crowd environment","venue":null,"work_id":"457212da-8c1e-446c-be39-9a0574cad940","year":2024},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.340395Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:8c6db9bae75ed3233e7a816419aea82f90bcef385f89c237dad764768b61b21c","observation_id":"12cc7b18-6bdd-4cfc-b193-6bec82c468e3","resolution":{"observed_at":"2026-08-05T14:52:57.633220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.608324Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"6b1c11f3-53a2-464e-92cb-4e1dacecac5b","year":2023},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.346705Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:10cfb51ba36d68f7ffd43264c01709a2cc0a1a4cb35220f021b96617998d9579","observation_id":"08215bc9-9815-481f-b791-de8ca74e229a","resolution":{"observed_at":"2026-08-05T14:52:57.614068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04383","last_updated":"2025-05-29T14:14:03Z","snapshot_observed_at":"2026-08-20T11:48:46.030114Z","submitted_at":"2024-12-05T17:58:43Z","title":"SeeGround: See and Ground for Zero-Shot Open-Vocabulary 3D Visual Grounding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04383","snapshot_observed_at":"2026-08-05T14:52:56.353243Z","title":"Seeground: See and ground for zero-shot open-vocabulary 3d visual grounding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.353243Z"},"links":{"cited_paper":"/paper/2412.04383","citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:8b006ef9c6bb74c2e13b8a6eab42070948fb4e2c4b2eb07b15256d489e0f0645","observation_id":"0b7dc8af-52a2-479e-9600-cd3c2817047a","resolution":{"observed_at":"2026-08-05T14:52:56.353243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.589772Z","title":"Exploring diversity-based active learning for 3d object detection in autonomous driving","venue":null,"work_id":"f56433e6-1a58-4423-b1ed-e21d9aa0a6dc","year":2024},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.360307Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:2b8dec767e11fb3d54d16aa4ed86d6edbe608edc66cb6f518fb0fb9851395070","observation_id":"3cb6d9ba-c4cf-4537-b51f-7763ddfb548f","resolution":{"observed_at":"2026-08-05T14:52:57.596404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.567979Z","title":"Unimel: A unified framework for multimodal entity linking with large language models","venue":null,"work_id":"6a96e787-c49d-4cf9-a17e-96dca777ae0c","year":1909},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.366605Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:ef0690c1cdf774ebaa19cb5f1c82b163f520b0b697a7463e9793b9537b7837a3","observation_id":"5b63f1d8-e305-40f4-b93b-80656a69654b","resolution":{"observed_at":"2026-08-05T14:52:57.575938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06886","last_updated":"2025-08-25T02:20:09Z","snapshot_observed_at":"2026-08-17T00:52:37.891311Z","submitted_at":"2024-07-09T14:14:47Z","title":"Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06886","snapshot_observed_at":"2026-08-05T14:52:56.374686Z","title":"Aligning cyber space with physical world: A comprehensive survey on embodied ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.374686Z"},"links":{"cited_paper":"/paper/2407.06886","citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:ced1a759768c80861f8c6849be3541e18005c485df3fb23eb890d85dec2f7eb9","observation_id":"59fa7543-c01d-489a-99ce-ea1df05d9300","resolution":{"observed_at":"2026-08-05T14:52:56.374686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.546445Z","title":"Group-free 3d object detection via transformers","venue":null,"work_id":"4f62b60d-098a-4d49-8b05-7f31ce918303","year":2021},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.382798Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:f89b4bc7f16842c0d423148f55c896e848d5e57453ccac31b3ad56800703126d","observation_id":"a474cd0f-8075-418d-a653-d005a19d3c64","resolution":{"observed_at":"2026-08-05T14:52:57.551556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.528659Z","title":"3d-sps: Single-stage 3d visual grounding via referred point progressive selection","venue":null,"work_id":"e470baf0-4edd-4929-8e6f-437e8973a973","year":2022},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.389909Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:ba6ba79b77ce185dc1a4e72ebbc2a0a429530a75c71486386be9bb45ac5b6120","observation_id":"2894a933-80c8-4244-9a30-d2ddea43f024","resolution":{"observed_at":"2026-08-05T14:52:57.534460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.509025Z","title":"Motion detection methods applied on rgb-d images for vehicle classification on the edge computing","venue":null,"work_id":"8c008367-ee39-49a6-8df0-e704f9a72b1f","year":2025},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.397368Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:c22d3fcea3838a6680a3452b1c5e53543b71d9fd245bc156f7582ac46042bb59","observation_id":"d1396919-487d-4234-9a7f-f414182eb64c","resolution":{"observed_at":"2026-08-05T14:52:57.515170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.490579Z","title":null,"venue":null,"work_id":"f2e8a364-f4d1-441d-885c-ea4866f385f9","year":2024},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.403558Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:783600181891b7cbc800abd07ffb0e114a0bb9dd4a6e612f2d1deb104deed729","observation_id":"a28df879-ae4f-4b19-aa2d-11a8b414b41b","resolution":{"observed_at":"2026-08-05T14:52:57.496701Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.472002Z","title":"Openscene: 3d scene understanding with open vo- cabularies","venue":null,"work_id":"573a7a07-eb0e-4001-839e-f8379579ca1f","year":2023},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.411890Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:4507cd1d05a70421124bd9926b1eb953709f4e85cacf689170313005649ac8a2","observation_id":"da167163-0f6b-405c-9577-a43856724288","resolution":{"observed_at":"2026-08-05T14:52:57.478019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.452968Z","title":"Zeetad: Adapting pretrained vision-language model for zero-shot end-to-end temporal action detection","venue":null,"work_id":"5fff4226-54e9-4ba7-b02a-41fd9b5fe5a1","year":2024},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.424846Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:73a4388ba48c924cd040229d498ac9e2e85876649a9d76a7cd71a39a25dc28df","observation_id":"2dc682c5-8b88-4f47-8743-98ec5722b1ad","resolution":{"observed_at":"2026-08-05T14:52:57.458714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.432615Z","title":"Multi-branch collaborative learning network for 3d visual grounding","venue":null,"work_id":"2d47fe3b-08dc-4e94-b2eb-075148ed957d","year":null},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.435892Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:165128ce1913dd9ed57160f085500df65ab22a06926b43815c6ab4fc0e64282b","observation_id":"ab0d0912-7183-4a0a-a9b1-8131e83bb483","resolution":{"observed_at":"2026-08-05T14:52:57.438240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.414614Z","title":"Rgb guided tof imaging system: a survey of deep learning-based methods","venue":null,"work_id":"398b8954-86f4-458f-8a82-cc0ab5ea9e70","year":2024},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.443723Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:8bac9c4060d3b6bdad8779d842da42c49400e2abdb59c52bfbfebb7da4fe05fa","observation_id":"fcfbc55b-b25a-424c-ac3b-737ad5591455","resolution":{"observed_at":"2026-08-05T14:52:57.421056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.395503Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"ae8a922f-0374-4457-9048-b89a13e574c7","year":2021},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.450536Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:bf562c04e9529ab94db54c48f40a1ad8aa1fac66fb3bb7d7b3c3dd555edf7327","observation_id":"17375a2c-5ed0-4412-a595-9e8541c2f4f0","resolution":{"observed_at":"2026-08-05T14:52:57.401319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.377795Z","title":"Mask3d: Mask transformer for 3d semantic instance segmentation","venue":null,"work_id":"c09d72c1-f2b9-411b-892b-8c30a979ca95","year":2023},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.459017Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:9d630aabb20c8737167ea0c93f6280e1e7b24327c8f3cde82334fc0a85e7e980","observation_id":"cfc997f9-2134-46ad-a9b9-583463092bc0","resolution":{"observed_at":"2026-08-05T14:52:57.382848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.360357Z","title":"Layer depth denoising and completion for structured-light rgb-d cameras","venue":null,"work_id":"0f8654bc-c02c-4d59-a150-349407d43943","year":2013},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.469178Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:1ee702ad768d7683b5b401e1ffd02bbb6e4bbba9b51e42d6130fa4f7cc86c4f5","observation_id":"51a7250b-54af-4979-8199-01bf8f27d8f6","resolution":{"observed_at":"2026-08-05T14:52:57.366219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00180","last_updated":"2023-05-31T20:58:46Z","snapshot_observed_at":"2026-08-19T12:09:57.404136Z","submitted_at":"2023-05-31T20:58:46Z","title":"FlowCam: Training Generalizable 3D Radiance Fields without Camera Poses via Pixel-Aligned Scene Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00180","snapshot_observed_at":"2026-08-05T14:52:56.477553Z","title":"Flowcam: Training generalizable 3d radiance fields without camera poses via pixel-aligned scene flow","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.477553Z"},"links":{"cited_paper":"/paper/2306.00180","citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:47be602b32a4bdb4418b5e5ab96db8d0178a730edf0576f1162d8e18eda0bebb","observation_id":"75c53b68-3a8c-4847-a567-629750cd4bc3","resolution":{"observed_at":"2026-08-05T14:52:56.477553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.338968Z","title":"Four ways to improve verbo-visual fusion for dense 3d visual grounding","venue":null,"work_id":"c2beb5bb-2b5c-45da-bc97-1e4190a80ca4","year":2024},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.486758Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:31b83fa587be10198169fb30305720b4fdfd50ac9a3c13931a5d55d0414e161f","observation_id":"d2284615-e8ac-48e2-ba2b-a20a4d0bcd39","resolution":{"observed_at":"2026-08-05T14:52:57.345561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.318931Z","title":"Soft- group for 3d instance segmentation on point clouds","venue":null,"work_id":"aeb3e84e-0fc4-4f59-a7bf-041d810fa557","year":2022},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.501498Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:0a4e2e1e89ce34673fe176978a3688a7dc5ffdb39614039f1f726c3a9bc69a77","observation_id":"bb55a291-2426-4ee4-b044-f93c6bddcf0a","resolution":{"observed_at":"2026-08-05T14:52:57.325286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:56.508265Z","title":"A survey on large language model based autonomous agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.508265Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:a5f63e4461e137562259c01bb692b62ebbb43c1eca7149515164e03ae15af52a","observation_id":"c38bbdc2-f353-45f8-9313-bf00ce49c775","resolution":{"observed_at":"2026-08-05T14:52:56.508265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.279616Z","title":"Gˆ 3-lq: Marrying hyperbolic alignment with explicit semantic-geometric modeling for 3d visual grounding","venue":null,"work_id":"c13ab2b2-f398-4128-953d-1a9bbe9c34df","year":2024},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.514240Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:ee79b16ca7e41fb30adbac6d2ffcd8684a0b22d1a4f3b1dbdb595e52035f7eaf","observation_id":"2c8136ec-b0cc-408b-98ee-2c570c9c52f3","resolution":{"observed_at":"2026-08-05T14:52:57.286237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08769","last_updated":"2023-08-17T03:52:15Z","snapshot_observed_at":"2026-08-20T07:15:08.903665Z","submitted_at":"2023-08-17T03:52:15Z","title":"Chat-3D: Data-efficiently Tuning Large Language Model for Universal Dialogue of 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08769","snapshot_observed_at":"2026-08-05T14:52:56.520945Z","title":"Chat-3d: Data-efficiently tuning large language model for universal dialogue of 3d scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.520945Z"},"links":{"cited_paper":"/paper/2308.08769","citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:2c9976ae7efa0c26e97c5f0735befe54c14e12affd695e2608e5cdf0a2582460","observation_id":"017e607c-924a-4e8a-aa8f-be3fa463b323","resolution":{"observed_at":"2026-08-05T14:52:56.520945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.253641Z","title":"Visionllm v2: An end-to-end generalist multimodal large language model for hundreds of vision-language tasks","venue":null,"work_id":"c599a925-4e24-4baa-bb12-829191e1ae2c","year":2024},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.530843Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:0d8cf75b560108a05f5990163080c9d29981c0f097eb3797925db8cad76da460","observation_id":"82ece06d-3727-4804-8444-c8647dbc7ae1","resolution":{"observed_at":"2026-08-05T14:52:57.262054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.229658Z","title":"Eda: Explicit text-decoupling and dense alignment for 3d visual grounding","venue":null,"work_id":"228725bf-07ec-4500-956e-953c4f0a105a","year":2023},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.540001Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:36facad9a7180df31e0c7579779e17d528f8878a15618a1cbe2febe4ee6c6582","observation_id":"30dee432-b79b-4c08-89ac-51d3e402f5f1","resolution":{"observed_at":"2026-08-05T14:52:57.236688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.202416Z","title":"M-divo: Multiple tof rgb-d cameras enhanced depth-inertial-visual odometry","venue":null,"work_id":"f65044b9-45ef-40f7-a8fb-be9aef5a5900","year":2024},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.555535Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:85c789961889721c8187c078733ad0b82e9f1b275a5b615d13a6f401121554ff","observation_id":"22945b12-b07a-4909-bd26-67a07473dffc","resolution":{"observed_at":"2026-08-05T14:52:57.209024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13860","last_updated":"2024-10-17T17:59:55Z","snapshot_observed_at":"2026-08-19T01:39:03.200835Z","submitted_at":"2024-10-17T17:59:55Z","title":"VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13860","snapshot_observed_at":"2026-08-05T14:52:56.561970Z","title":"Vlm-grounder: A vlm agent for zero-shot 3d visual grounding.arXiv preprint arXiv:2410.13860, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.561970Z"},"links":{"cited_paper":"/paper/2410.13860","citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:094193c3516a5f1926acbf3bc939b7a716e91a39963201f3c82a6014e66d31e4","observation_id":"e338d33b-6e96-42b4-afde-065288427dff","resolution":{"observed_at":"2026-08-05T14:52:56.561970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.177173Z","title":"Multi-scale 3d gaussian splatting for anti-aliased rendering","venue":null,"work_id":"b16b31da-8eee-4fe5-aa2b-d9d7758cc2e5","year":2024},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.569700Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:5dc4a9aba026d4b5f11ea15cb4f48eb8d67643be090b39b495b6bde79b01bd93","observation_id":"503a2737-6be6-4e3d-9999-2bc2b96f1b6c","resolution":{"observed_at":"2026-08-05T14:52:57.187657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.153091Z","title":"Llm-grounder: Open-vocabulary 3d visual grounding with large language model as an agent","venue":null,"work_id":"5b7e7343-1c7b-4a42-833e-5e24f07e85e5","year":2024},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.576596Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:1bd354856baf8dab6eb1a60bd2d331139b8968f7d7a37b0bb95c695446fcc781","observation_id":"41fc1ef3-9624-4cc4-a24c-dae122c638b4","resolution":{"observed_at":"2026-08-05T14:52:57.159395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.130362Z","title":"Sat: 2d seman- tics assisted training for 3d visual grounding","venue":null,"work_id":"12de2085-3e3d-43d9-8b98-d9482dba9756","year":2021},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.586265Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:277f3e7c73a9065f8e6c5153d61f90051132aa4beaa5f99db7760b0a615cf85b","observation_id":"38e77606-d363-486c-b4f1-dc34bab4e660","resolution":{"observed_at":"2026-08-05T14:52:57.137228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.104772Z","title":"Visual programming for zero-shot open-vocabulary 3d visual grounding","venue":null,"work_id":"3e5f4a4e-4ff4-454d-80a8-053f035675f1","year":2024},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.592666Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:b07e5ee871ea0e8dd04036d62594385dbcc76e7a61e1bf0908e06eb8cbb7f98a","observation_id":"0b1a98e0-f57e-4432-89bd-2e6ea9d60370","resolution":{"observed_at":"2026-08-05T14:52:57.112222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.080883Z","title":"Instancerefer: Cooperative holistic understanding for visual grounding on point clouds through instance multi-level contextual referring","venue":null,"work_id":"587c6115-5f64-47d7-8e7b-467350234357","year":2021},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.599200Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:f7a4015f0fce095579f8acc9689157dac58e1fe5805586426df55436f2e5d723","observation_id":"8c33f02d-03c2-4d0d-9ab1-80b6b59feb57","resolution":{"observed_at":"2026-08-05T14:52:57.087980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.049205Z","title":"Vision- language pre-training with object contrastive learning for 3d scene understanding","venue":null,"work_id":"3e4bbd21-950e-4ddd-b8b5-c0006776401a","year":2024},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.604221Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:42e47307d404749f2bfcd04e73f8c2ace9e16abb402a6b9acb9ceee547246096","observation_id":"aa535d2a-e145-4f14-b93e-0b2ed1a7e55e","resolution":{"observed_at":"2026-08-05T14:52:57.061599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.023434Z","title":"Earthgpt: A universal multi-modal large language model for multi-sensor image compre- hension in remote sensing domain","venue":null,"work_id":"60aeeb0f-ab87-41e3-ab61-2db7984a9318","year":2024},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.610673Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:2d0fa0143cf453a099767abcdc59c1295efc3ca33284b0ebf76201e1aa6edeab","observation_id":"2fe3438f-cdb9-40e8-aca6-498ea0278de2","resolution":{"observed_at":"2026-08-05T14:52:57.031356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:57.001934Z","title":"Prototype correlation matching and class-relation reasoning for few-shot medical image segmentation","venue":null,"work_id":"33ae49fb-fae1-42f0-bf93-6a12d7501f0c","year":2024},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.618028Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:3bdd825bfdbc765ad9d482a72374d7ad6411a3902c802bf49b72d6e9fb7be27d","observation_id":"0b728035-ee44-4732-9c1a-821ec498204b","resolution":{"observed_at":"2026-08-05T14:52:57.008060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:56.982501Z","title":"Towards clip-driven language-free 3d visual grounding via 2d-3d relational enhancement and consistency","venue":null,"work_id":"c69cc8eb-e893-4632-a5fb-ca8611dbcbb8","year":2024},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.624278Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:baf2ff39ba0aa40f9b43b3acb2f3049363418a2dc5cfeec94eca416e7a2b1b64","observation_id":"b9b082a4-124e-49cc-9ee4-fb7012c521dd","resolution":{"observed_at":"2026-08-05T14:52:56.988486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:56.962442Z","title":"3dvg-transformer: Relation modeling for visual grounding on point clouds","venue":null,"work_id":"cc2ed646-678f-412e-a935-c7f11c8cb072","year":2021},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.632131Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:8a5369bd3603fb11c0564e4a5675a05f634b5d8b5867012c5e6622fe903b7a14","observation_id":"b13345a0-b608-441d-9db4-79cd25ef9a13","resolution":{"observed_at":"2026-08-05T14:52:56.967903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-20T00:34:15.368096Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03324","snapshot_observed_at":"2026-08-05T14:52:56.639839Z","title":"A stitch in time saves nine: Small vlm is a precise guidance for accelerating large vlms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.639839Z"},"links":{"cited_paper":"/paper/2412.03324","citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:7b0f47df1c98d8f0eab38e7ad0c1146b9434813e73fb59b8be9559e0b60cee02","observation_id":"40c8c8cd-cadc-47ae-af50-4b537eae3337","resolution":{"observed_at":"2026-08-05T14:52:56.639839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:56.940079Z","title":"Preventing zero-shot transfer degradation in continual learning of vision- language models","venue":null,"work_id":"86e5a20e-ec31-40a1-940f-95d37553b7c9","year":2023},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.651430Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:ffe50bc0374a2b21e3ab33570ef5e01becdf9c5a88243a1c85f9ee531aa5dd47","observation_id":"792e4048-406c-456f-9dcf-b83522ea03be","resolution":{"observed_at":"2026-08-05T14:52:56.946876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:52:56.914052Z","title":"Context-aware 3d object detection from a single image in autonomous driving","venue":null,"work_id":"8736353c-5d1f-4ebb-85c6-e91ff0890879","year":2022},"citing_paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T14:52:56.660665Z"},"links":{"citing_paper":"/paper/2508.20758"},"observation_digest":"sha256:f0448f5a011650c9671f54162eb59ab66ed5a2842d67e1e5a114af8028868db2","observation_id":"10c7c7cc-b94a-4f83-bf7c-0cd4cffb383e","resolution":{"observed_at":"2026-08-05T14:52:56.923793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.20758","last_updated":"2025-08-28T13:15:37Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T13:01:40.398185Z","submitted_at":"2025-08-28T13:15:37Z","title":"SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":50},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2508.20758."}