{"as_of":"2026-08-10T06:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d0c98103433a536ce15388c21f808f2cb793322d58ed3b67c67f8822bc4009a1","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:18:14.922481Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.11261/citation-record","integrity":"/paper/2507.11261/integrity","json":"/paper/2507.11261/citation-record.json","paper":"/paper/2507.11261"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:23.341378Z","title":"Referit3d: Neural listeners for fine-grained 3d object identification in real-world scenes","venue":null,"work_id":"96f31d3e-8081-4246-b273-ce2551aa4b2c","year":2020},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:10.932060Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:05074261147d4995e1bc3094bfde9adfccc075f0fe4184ec98ae619ac31d0ad9","observation_id":"99a5221d-5176-43af-abae-2f73a0eb4af0","resolution":{"observed_at":"2026-08-06T17:18:23.475431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:23.066605Z","title":"Cot3dref: Chain-of-thoughts data-efficient 3d visual grounding","venue":null,"work_id":"3e17ea2c-39a3-42aa-a8c3-07b8a5f95c3d","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.018378Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:5ccd6f7195481237058a9c4ccb7dd5913e930b2630d81905f0f2f2a0790c99ab","observation_id":"f975c64a-485f-4d78-9f8d-dc42fbe8e48a","resolution":{"observed_at":"2026-08-06T17:18:23.222477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:22.867187Z","title":"Visual question answering from another perspective: Clevr mental rotation tests","venue":null,"work_id":"145a8ccd-7a2d-4a5c-82d8-f497ecd0879e","year":2023},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.096372Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:04f888f126da1fa0b31c00a87c25e82e38e95212a57a81cc50d94c2f7013b3c3","observation_id":"f4e61f26-db46-490f-aba8-0eb1df005f13","resolution":{"observed_at":"2026-08-06T17:18:22.964487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:22.678992Z","title":"Assertiveness-based agent communica- tion for a personalized medicine on medical imaging diag- nosis","venue":null,"work_id":"8d278235-1d76-4b2c-b51d-371958c8b1df","year":2023},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.162571Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:3a63690e25f80c3f87a5f74558220ce44e37cb398ab137fdd961ccc5da8497ca","observation_id":"d4dc29a6-0669-4bdd-976d-eb467977906c","resolution":{"observed_at":"2026-08-06T17:18:22.729024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:22.496937Z","title":"Mikasa: Multi-key-anchor & scene-aware transformer for 3d visual grounding","venue":null,"work_id":"1661686d-d15a-464c-86fe-09cefada1ff7","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.232514Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:18d332cc4021bd481bdd5820ef2a70e0c252fa59b08fd6a2815c7b0a5a8da9a1","observation_id":"a17f72e6-33c7-48fc-a038-94af86b7efcf","resolution":{"observed_at":"2026-08-06T17:18:22.578516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:22.293578Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":"64dc8009-1aea-4e9f-8527-987e1d33e7dd","year":2020},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.272693Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:c70004afdc6257758fd83fe779be60d7662c579ddcf6b72b1617cff88e686f95","observation_id":"526e06e0-2a1c-4bec-b757-a07af60d434d","resolution":{"observed_at":"2026-08-06T17:18:22.419009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14097","last_updated":"2025-07-05T06:26:01Z","snapshot_observed_at":"2026-08-07T16:55:21.515278Z","submitted_at":"2025-03-18T10:14:49Z","title":"SCJD: Sparse Correlation and Joint Distillation for Efficient 3D Human Pose Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14097","snapshot_observed_at":"2026-08-06T17:18:11.315194Z","title":"Scjd: Sparse correlation and joint distillation for efficient 3d human pose estimation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.315194Z"},"links":{"cited_paper":"/paper/2503.14097","citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:501097c4be844802cbc66f14fb568487bc292f1f7b428eaa51b6ed2387956ec7","observation_id":"59de1d01-e895-4fa6-baea-6d5f6edca71a","resolution":{"observed_at":"2026-08-06T17:18:11.315194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:22.174700Z","title":"Talk2bev: Language-enhanced bird’s- eye view maps for autonomous driving","venue":null,"work_id":"c784c20e-af1b-40bf-93de-301b9831ac33","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.372304Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:b19c5fbd1dc69b05f827a17c5bf8c9bdec12a1c7289ce0531f6918b6b07ea34f","observation_id":"eccb3eba-6be2-470e-bbeb-bf59790be25d","resolution":{"observed_at":"2026-08-06T17:18:22.228420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:21.973515Z","title":"Drive as you speak: Enabling human-like interac- tion with large language models in autonomous vehicles","venue":null,"work_id":"f36760b7-eeb3-4a60-8101-d31d6c77db61","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.459556Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:bf5ba20171eb3e2bb3825ff4ab48c9b0aa778c9e36fcb9d9233ab75a893d1925","observation_id":"1dc3fd23-afd9-4983-abd1-963c1e72f9a5","resolution":{"observed_at":"2026-08-06T17:18:22.060228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:11.526902Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.526902Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:18c32d318c3a5b03b5e1b73a30959ca8d63e5be67b5a42f594733058a47338e4","observation_id":"1c2babb7-5748-4946-a129-a39f62ca7b64","resolution":{"observed_at":"2026-08-06T17:18:11.526902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T17:18:11.558820Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.558820Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:7d2a8eeb05525c4f67a6be37dadad702a401beb1dda088766226857b8f621d64","observation_id":"0ffb4a29-cc63-41ed-8328-6490f340850e","resolution":{"observed_at":"2026-08-06T17:18:11.558820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:21.780888Z","title":"Scenegenie: Scene graph guided diffusion models for image synthesis","venue":null,"work_id":"832614d8-169a-4109-b552-e9241512d7f3","year":2023},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.609396Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:8bf242320a8ca528c302d7112415bc89b3e802ff4c3e762a2c08b6fcaf87be2e","observation_id":"ade96116-986d-4715-878b-0a4040aa684d","resolution":{"observed_at":"2026-08-06T17:18:21.859773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:21.634383Z","title":"Dense reinforce- ment learning for safety validation of autonomous vehicles","venue":null,"work_id":"0b97cbb7-aaec-40eb-9244-c091a5c2e628","year":2023},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.725233Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:80aabb3f6da0d5f27cb313f5b614f1cb46c0eb1dfbbd088b1fe134d2481ab1ba","observation_id":"94dd748e-1e5b-4db3-abdf-d3114273a179","resolution":{"observed_at":"2026-08-06T17:18:21.686087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:21.483733Z","title":"Viewinfer3d: 3d visual ground- ing based on embodied viewpoint inference","venue":null,"work_id":"ab85b0e7-2974-42f4-839f-dc6c11557b73","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.814980Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:5385bfd54f1707a509ddfe9336762c5bdf8d27c9c9125ba0e6769142055e20ef","observation_id":"af1fb14e-7516-443a-8274-73fcc2fbc43c","resolution":{"observed_at":"2026-08-06T17:18:21.525736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:21.315830Z","title":"Viewrefer: Grasp the multi-view knowledge for 3d visual grounding","venue":null,"work_id":"19b4c82a-39ca-4ed6-bff1-98cdf5498d6f","year":2023},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.879963Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:f22766be4f3deb16a44570a881db8fb4491c324eff04a6ebe2afe5a792605d26","observation_id":"e05dd4c4-9cf5-4bd0-8f03-d88fee1038db","resolution":{"observed_at":"2026-08-06T17:18:21.382853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:21.169607Z","title":"Transrefer3d: Entity-and- relation aware transformer for fine-grained 3d visual ground- ing","venue":null,"work_id":"139573ea-f9a8-4e32-a725-9eef119f4f0c","year":2021},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.960630Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:006f1c37d31d37fa63cebeca67f5001a82b35a5aab0180f901974ab282a9de18","observation_id":"10802696-30ec-4432-802d-8d1ad2a2a2ba","resolution":{"observed_at":"2026-08-06T17:18:21.222781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:12.036499Z","title":"3d-llm: In- jecting the 3d world into large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:12.036499Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:9f0f6ead71fdeb1a7816d0b31f122569d86c88ee84b446080dfe865915bb13d8","observation_id":"871a281a-822f-48d2-b87e-f017dd6f71da","resolution":{"observed_at":"2026-08-06T17:18:12.036499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:21.041221Z","title":"Multi- view transformer for 3d visual grounding","venue":null,"work_id":"ed5f0271-0465-478e-b07d-cf81126aa699","year":2022},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:12.169841Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:51d630e84a004f9fcb8f131345c1af88b03bdd090f2d912b14456229e88b5d3b","observation_id":"be0bd385-f4ef-4432-8a79-37595d71b9e9","resolution":{"observed_at":"2026-08-06T17:18:21.108849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:20.866618Z","title":"Structure-clip: Towards scene graph knowledge to enhance multi-modal structured repre- sentations","venue":null,"work_id":"6dfef9ab-5c39-4454-9160-97b091ad2796","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:12.226913Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:9eea37f3a3699339fa192d23338509985adbe7ae4a1e594da1b5edce1a29071d","observation_id":"fe61d437-8966-45a3-b4d8-9ffb6c95ed08","resolution":{"observed_at":"2026-08-06T17:18:20.956537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:20.666524Z","title":"Nan-detr: noising multi-anchor makes detr better for object detection","venue":null,"work_id":"bb12491a-8090-4214-b32d-08bbd4ab6057","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:12.302592Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:3b9b1767920298fea14a6e10073e71d16e621abfd117b0c181e2cfbdf8c69828","observation_id":"1447d34a-0364-45f7-9836-3487acfcbaec","resolution":{"observed_at":"2026-08-06T17:18:20.759454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:20.548287Z","title":"Bottom up top down detection transform- ers for language grounding in images and point clouds","venue":null,"work_id":"b3b5b988-9067-4b83-a2a1-a4217cef900d","year":2022},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:12.337407Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:2c3bc1b07a89e30e6a2668093ee63fb1cd385f8a7ffe5bf74e95ab8b630a9869","observation_id":"c7234e13-59d2-4e77-a0e8-722b6bfeb5ee","resolution":{"observed_at":"2026-08-06T17:18:20.616504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:20.431728Z","title":"Sita: Struc- turally imperceptible and transferable adversarial attacks for stylized image generation","venue":null,"work_id":"6f8f1691-7f20-4997-9992-18a7b15c7915","year":2025},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:12.420336Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:f4b23ca3409373ba0c8a44a3ecb0832d5865a4c40edb0e004e468df3f91b055e","observation_id":"20737413-972d-41be-8b38-9cf6e05427b4","resolution":{"observed_at":"2026-08-06T17:18:20.474489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:20.259414Z","title":"Is-ggt: Itera- tive scene graph generation with generative transformers","venue":null,"work_id":"1122bcd8-f990-4c8f-8600-b6a3bb94bee4","year":2023},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:12.464267Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:7e5d02c7b60b1091800266510e62602262ebc0a74e8171bf5f7ae4f365be7421","observation_id":"0a65a579-0f29-4f63-8d2d-aea7735b381e","resolution":{"observed_at":"2026-08-06T17:18:20.356956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:20.094485Z","title":"Panogen: Text-conditioned panoramic environment generation for vision-and-language navigation","venue":null,"work_id":"441201b4-9ea2-42b5-be83-004dd1d72d54","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:12.567526Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:b4a07b5c16567c2fa1031ac831801a8247fe55d35be622a9eff83c7c570697ed","observation_id":"379d5fb8-6792-49bd-994f-0a4a458fb316","resolution":{"observed_at":"2026-08-06T17:18:20.153322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:19.942491Z","title":"Delving into in- visible semantics for generalized one-shot neural human ren- dering","venue":null,"work_id":"34fdaa31-f458-4e22-86fb-b4dfeac837c3","year":2025},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:12.610425Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:6d80e5a38564003a32d58695f253b3b289fa9235caa4bb32b6bca6ba6ef497c6","observation_id":"10e9e04c-bdb5-43e1-9a72-f80606081a36","resolution":{"observed_at":"2026-08-06T17:18:20.017204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:19.843316Z","title":"Multi- modal situated reasoning in 3d scenes","venue":null,"work_id":"30ce3e49-75f3-4db0-897d-0dae8a4e6fb3","year":2025},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:12.672393Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:89808c3e132b4cbc57813000fd92d3d9c224ef6408d917f310d6793eb5ce88d7","observation_id":"eac386b2-18cb-4782-833e-b7e25bd217ad","resolution":{"observed_at":"2026-08-06T17:18:19.881172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T17:18:12.730320Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:12.730320Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:d188c69c1e7539a93a7fbb2f3c3ee6d007f3831c096a6e4c9bc2cd8e99e8f547","observation_id":"92964dcf-8d01-48f2-8a93-fcf256401bc5","resolution":{"observed_at":"2026-08-06T17:18:12.730320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:19.724820Z","title":"Rotation-adaptive point cloud domain generalization via intricate orientation learning","venue":null,"work_id":"ea169f5b-d9b5-475e-a79d-3993ab4d1d8b","year":2025},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:12.792481Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:23bd02122b4cdc582f6801aefc002e54c5601f179903d182e63a17e5e7416f8b","observation_id":"69934a9d-b77c-4eec-bdd4-0c747b923a4b","resolution":{"observed_at":"2026-08-06T17:18:19.793645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T17:18:12.856045Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:12.856045Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:c17e80fcf089f96598c5660966d08a96410ab478f3e26e4c29211061ff0ffa88","observation_id":"8d336ad7-7f9f-40a3-919c-4fe67cba887e","resolution":{"observed_at":"2026-08-06T17:18:12.856045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:19.580049Z","title":"Mmscan: A multi-modal 3d scene dataset with hierarchical grounded language annota- tions","venue":null,"work_id":"3da1b977-c4c9-4892-bd3d-0f31970cc2ec","year":2025},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:12.907511Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:a76ddb19a290468104f1a63804a589ed2de14920851d26004876660da7a8a1d8","observation_id":"f2e1b9c6-b79e-4826-b41e-d6d679641ab6","resolution":{"observed_at":"2026-08-06T17:18:19.641153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:19.474115Z","title":"Situa- tional awareness matters in 3d vision language reasoning","venue":null,"work_id":"ceb8e511-d4bc-4540-a692-7b6321af822b","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.002554Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:0e0c3791eef57f5175ad95763d1047b4f87516ce4e26c528ca6b3bd5d93114d0","observation_id":"6cb05e79-39f8-48c6-83b4-0778956ae5e7","resolution":{"observed_at":"2026-08-06T17:18:19.530994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:19.317379Z","title":"Textrank: Bringing order into text","venue":null,"work_id":"0eaf1266-e24c-4a72-9e80-7fcd98c026b3","year":2004},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.049968Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:b23fa7f20da58cce038307eeba97fcddb976e0de2e1966f3ff3089c9eab9c007","observation_id":"b1d8da55-3518-489d-841a-e30ffcb33ad9","resolution":{"observed_at":"2026-08-06T17:18:19.415622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:19.164207Z","title":"Gaussian prompter: Link- ing 2d prompts for 3d gaussian segmentation","venue":null,"work_id":"0d71f912-f4d9-49d5-8b50-b3901511c5bc","year":2025},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.117883Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:73d184edbb5a7bbf53e3f2be69cb47d909cbf7b4bac39abc871e848f1ec7bbff","observation_id":"7baa5367-9431-4ebf-9dab-b0e614a4469c","resolution":{"observed_at":"2026-08-06T17:18:19.242942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:19.044388Z","title":"An approach to gener- ate a caption for an image collection using scene graph gen- eration","venue":null,"work_id":"78f9c680-2e97-4e38-8705-74fd0b7c45f1","year":2023},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.165411Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:c555b7478208589237e579077a463a1395c784ca69db315fe45f51ff59185efc","observation_id":"c0cb8c5d-fc43-440c-8122-b81e486fd0af","resolution":{"observed_at":"2026-08-06T17:18:19.100794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:13.209464Z","title":"Pointnet++: Deep hierarchical feature learning on point sets in a metric space","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.209464Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:cdceb5a6b7d8f87ce418efc79698e2d2fc8ddd32a76147cdceaa55a057991a6b","observation_id":"9d956151-940c-4880-8a83-724d8a8d0321","resolution":{"observed_at":"2026-08-06T17:18:13.209464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:18.726704Z","title":"Languagerefer: Spatial-language model for 3d visual grounding","venue":null,"work_id":"3e78bd6f-e90f-467f-95f2-649b91a11da9","year":null},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.264346Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:9b3a5251e9b6796c84e6da79d8ad94980b9de87ac6e601eff47c47e11f702999","observation_id":"7aca918f-4f06-4bbe-8c3a-8ccfbe288b3a","resolution":{"observed_at":"2026-08-06T17:18:18.899318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:18.477909Z","title":"Aware visual grounding in 3d scenes","venue":null,"work_id":"3ac552dd-bb4f-4be1-a5f3-4bb29560eb86","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.302172Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:4c7d8912f27551e71802a1015090c0361a3fea5f0c2a39d662ba37277a91e7ae","observation_id":"0dc6fb11-c63d-4a44-8000-0772f5480f73","resolution":{"observed_at":"2026-08-06T17:18:18.591055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03314","last_updated":"2023-06-05T23:55:37Z","snapshot_observed_at":"2026-08-05T20:35:55.884484Z","submitted_at":"2023-06-05T23:55:37Z","title":"Multi-Agent Collaboration: Harnessing the Power of Intelligent LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03314","snapshot_observed_at":"2026-08-06T17:18:13.353401Z","title":"Multi-agent col- laboration: Harnessing the power of intelligent llm agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.353401Z"},"links":{"cited_paper":"/paper/2306.03314","citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:48ed40c130ab4b2e5b8e878e14d9f2994e5491aa764a48c4578842fdbc066c85","observation_id":"c8ca42ed-25ea-4e09-bf48-939444c1df02","resolution":{"observed_at":"2026-08-06T17:18:13.353401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:13.395000Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.395000Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:729c022189212ecb2458bff00d551743e75998a5a0aa747a729f638df422bf41","observation_id":"1478cb02-15b0-46d6-92fe-72defd0eb2b3","resolution":{"observed_at":"2026-08-06T17:18:13.395000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11235","last_updated":"2024-03-16T04:32:25Z","snapshot_observed_at":"2026-08-07T05:19:58.002826Z","submitted_at":"2023-09-20T11:54:40Z","title":"OpenChat: Advancing Open-source Language Models with Mixed-Quality Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11235","snapshot_observed_at":"2026-08-06T17:18:13.463357Z","title":"Openchat: Advancing open-source language models with mixed-quality data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.463357Z"},"links":{"cited_paper":"/paper/2309.11235","citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:125e388d9a0650f441a838652e4bb0f676f18422abec9f854dde698aa2fa6560","observation_id":"3fb44b95-ce78-4a3d-a504-3ebc3c94a86f","resolution":{"observed_at":"2026-08-06T17:18:13.463357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:18.228521Z","title":"Gˆ 3-lq: Marry- ing hyperbolic alignment with explicit semantic-geometric modeling for 3d visual grounding","venue":null,"work_id":"f7511793-d7ac-4280-9490-e9ed87a0cb7d","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.530305Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:f64639557e4c970ec8ef925615b9a311d9b44c04199ff1235798714948db571d","observation_id":"4abf7b5a-2bff-4eba-b2a7-666fe6aa4823","resolution":{"observed_at":"2026-08-06T17:18:18.360406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:17.969482Z","title":"Eda: Explicit text-decoupling and dense alignment for 3d visual grounding","venue":null,"work_id":"07dae306-7be1-45da-8cc2-ba84326a2a20","year":2023},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.577268Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:11d1827cdd68a22e7458f707385523cd29561bc3b130bb5edb86f265f826fadc","observation_id":"c3063547-1f1d-4b65-bd7c-d838fb358d06","resolution":{"observed_at":"2026-08-06T17:18:18.114493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:17.774580Z","title":"Multi- scale flow-based occluding effect and content separation for cartoon animations","venue":null,"work_id":"9d554149-90cf-46af-a308-fea106104224","year":2022},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.656275Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:a56ace20f5ea06553224044aa421913953e8bc5062e0098512a61d3150b58d4b","observation_id":"4f8a1019-7534-49a9-91ef-647eee7f552d","resolution":{"observed_at":"2026-08-06T17:18:17.875702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:17.527737Z","title":"Multi-attribute interactions matter for 3d visual grounding","venue":null,"work_id":"bb6dd697-51f5-4aac-a5e7-11950e36a46a","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.741285Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:a66849d97cc225ce35cb55a8f0dc5943d90b07e5c3384a4a317cfd8e5613d81b","observation_id":"dc991a12-da9e-4040-aea2-80f2cd5f3ce3","resolution":{"observed_at":"2026-08-06T17:18:17.663023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:17.327969Z","title":"Learning with unreliability: Fast few-shot voxel radiance fields with relative geometric consistency","venue":null,"work_id":"4e2c86c7-4b90-4708-afe8-dde0e7247aa2","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.829101Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:8ca8137507c267e34ae37299daa85502af3b3b8116d022e1ae8a238f0e8e17d7","observation_id":"4f1a0181-73b4-4da4-9ebb-d7a7579bb0f1","resolution":{"observed_at":"2026-08-06T17:18:17.436049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T17:18:13.861692Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.861692Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:fc3b4881f3b814f5086b6c66c1e475322a20c4ec2c29f2ae7f967b29fee9129d","observation_id":"8d5e569b-edb4-48de-9a4f-f24c278d71fa","resolution":{"observed_at":"2026-08-06T17:18:13.861692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:17.135089Z","title":"G2face: High-fidelity reversible face anonymization via gen- erative and geometric priors.IEEE Transactions on Informa- tion Forensics and Security, 2024","venue":null,"work_id":"46d12992-7857-496f-93aa-5c28e91cbe9f","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.971665Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:07875ff15b84d8233c7ebbc28a80761bcf9365d22702e58eb37bb9bc456a28cb","observation_id":"dee07287-1d11-4c9a-8419-d1521f62ed39","resolution":{"observed_at":"2026-08-06T17:18:17.218042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:16.839781Z","title":"Sat: 2d semantics assisted training for 3d visual grounding","venue":null,"work_id":"52e72f2e-8473-4165-9501-bb0b17702d77","year":2021},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:14.062628Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:0beb0509a6bce9dd31c0a64f07649e4fb96db524962603dae184b73a2354805a","observation_id":"410dc413-a061-453c-afe6-3e74887c004c","resolution":{"observed_at":"2026-08-06T17:18:17.017863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13771","last_updated":"2026-07-05T07:51:04Z","snapshot_observed_at":"2026-08-04T19:11:48.797552Z","submitted_at":"2023-12-21T11:52:45Z","title":"AppAgent: Multimodal Agents as Smartphone Users","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13771","snapshot_observed_at":"2026-08-06T17:18:14.165736Z","title":"Appagent: Multimodal agents as smartphone users","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:14.165736Z"},"links":{"cited_paper":"/paper/2312.13771","citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:b43c602272ffe7ce711e9a128c10565930657b59e4e532b43cae9acbf824e74b","observation_id":"c51e1a3b-11e9-4557-aa96-26c9f73191b1","resolution":{"observed_at":"2026-08-06T17:18:14.165736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:16.639311Z","title":"Visually-prompted language model for fine-grained scene graph generation in an open world","venue":null,"work_id":"af691203-e3e2-4e67-9e79-42bad5df7ae7","year":2023},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:14.205944Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:59a38c0024da5dde870f904b45d55efcadc7b724b968d50724c01e4b2e9fb08c","observation_id":"7285a952-e166-495d-96f7-3e13a0c27a45","resolution":{"observed_at":"2026-08-06T17:18:16.729026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:16.453690Z","title":"Visual programming for zero-shot open-vocabulary 3d visual grounding","venue":null,"work_id":"ae6c4d1b-9c59-46dd-b3fc-bda3d693782a","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:14.295905Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:aad608c29118c7f7c800a36e2f41b7bbd725f3c557d0c66f30296f0eba210c52","observation_id":"50924109-6dab-4f3e-b74f-a1aaabe18993","resolution":{"observed_at":"2026-08-06T17:18:16.560839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:16.228712Z","title":"Multi3drefer: Grounding text description to multiple 3d ob- jects","venue":null,"work_id":"f6cfa782-ac56-4db6-928a-fdc3c7ca1d64","year":2023},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:14.401402Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:fae04f68b4693f8243fdcf2a5c2264b4cf736263b234920ef5ac075aa36d256e","observation_id":"0d2a8417-3822-4740-b6da-d5ad400d68f9","resolution":{"observed_at":"2026-08-06T17:18:16.325888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:16.043043Z","title":"Towards clip-driven language-free 3d visual grounding via 2d-3d relational en- hancement and consistency","venue":null,"work_id":"a8ba530e-5cd0-4d59-b26b-c2b6619af766","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:14.470853Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:4658203f249e1fd9381722f5901d09122a6b56cbbc60174747eb4a9bad87fbcf","observation_id":"d7249bfb-ba41-47a9-91ba-e54441ddf6c2","resolution":{"observed_at":"2026-08-06T17:18:16.133141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:15.888082Z","title":"3dvg- transformer: Relation modeling for visual grounding on point clouds","venue":null,"work_id":"df3154d7-35a9-44dd-87db-686c0ed1f8fd","year":2021},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:14.561773Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:3f694761a5fca267d9218c153ba05fe0de4bc1f5760f2a954fe54bfcf74035ea","observation_id":"4fe4caae-2393-4b23-ac9e-4e82e6bb8ea6","resolution":{"observed_at":"2026-08-06T17:18:15.958457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:15.677437Z","title":"Recdreamer: Consistent text-to-3d generation via uniform score distillation","venue":null,"work_id":"de565996-f44f-45fc-b84d-9bf94b0a6662","year":null},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:14.688627Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:12ef09bc4bc94a737677acb4ff4071368745362032c449bf179afce828fc12dd","observation_id":"b2d39ab7-26b5-4deb-b54a-4aa8bcd4585e","resolution":{"observed_at":"2026-08-06T17:18:15.769685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:15.474400Z","title":"Learning an interpretable stylized subspace for 3d-aware animatable artforms","venue":null,"work_id":"aef3dff1-c36f-4961-b84f-f939ef2b12f2","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:14.768209Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:75f661f988fcfd98df6121ac5326aa90ef0d13799310da7aec736d6c4c1b8204","observation_id":"0f8264bd-dc26-47cd-bb8e-d9ba862e5af3","resolution":{"observed_at":"2026-08-06T17:18:15.560384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:15.286707Z","title":"Navgpt: Explicit reasoning in vision-and-language navigation with large lan- guage models","venue":null,"work_id":"14c2c995-a09f-49be-a604-4130b62768ae","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:14.861449Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:119a1da481931a5b21fbebbc0967b51ba19eb3a7f82f820475881d9a4872e175","observation_id":"24fadd34-555f-417a-b47b-443df573e8d0","resolution":{"observed_at":"2026-08-06T17:18:15.365406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:15.071877Z","title":"Unifying 3d vision-language understanding via prompt- able queries","venue":null,"work_id":"5737a059-06fb-477c-a8f1-5b7ae57a3d16","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:14.922481Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:2c151f58930aad6a2463914ac7b161a19d9a850097c89302ff580c5594b8c373","observation_id":"39697c49-7872-4fd2-bc57-0ee034b57ec5","resolution":{"observed_at":"2026-08-06T17:18:15.154024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":46},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2507.11261."}