{"as_of":"2026-08-09T13:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c9534ed22b52b7d2f10e7ce6fae1231ce7dba4df5ecbaa68e584a6369e6d1d98","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:48:06.435172Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T15:16:35.591649Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20110","snapshot_observed_at":"2026-07-31T15:16:35.591649Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-09T05:34:58.893922Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.591649Z"},"links":{"cited_paper":"/paper/2507.20110","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:497db4331fc498b6f8bbf77970471a3ac6be2bf134311b6139a681dbac9edf68","observation_id":"a33bd187-fc65-4803-86b4-289a43d4f062","resolution":{"observed_at":"2026-07-31T15:16:35.591649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.20110/citation-record","integrity":"/paper/2507.20110/integrity","json":"/paper/2507.20110/citation-record.json","paper":"/paper/2507.20110"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T13:48:00.428975Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:00.428975Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:1af6a3819b28388914c356db8ad4af15fce44c55900f86539c0dba40ae6b08f9","observation_id":"b835252d-3b07-40c9-a903-615b1f03eb5e","resolution":{"observed_at":"2026-08-06T13:48:00.428975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:14.709894Z","title":"Referit3d: Neural listeners for fine-grained 3d object identification in real-world scenes","venue":null,"work_id":"be895d69-112c-4501-9a5b-5436cc76da39","year":2020},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:00.496994Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:39330cfee53b6e46ec676419e923685deaa5dead3b38e25a02effbccd648d49f","observation_id":"f86a609e-f11a-4be5-a3ef-d675240390ea","resolution":{"observed_at":"2026-08-06T13:48:14.765120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:00.578854Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:00.578854Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:68ce455633fb865492ac376e09f048f0250d61b294bda927eda17c1ed2634087","observation_id":"e36935a6-65fa-4b73-8f8e-fc504753a67f","resolution":{"observed_at":"2026-08-06T13:48:00.578854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:14.504741Z","title":"ShapeNeRF–Text: A Dataset of Neural Object Renderings with Rich Language Descriptions","venue":null,"work_id":"24f351f2-2e23-4312-9d34-af03ea2281d8","year":2024},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:00.679459Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:d4798ec7f88ebf330437962085206cc4bcdb7eae793fec03c8af59c1b507052f","observation_id":"e5e5bd75-cc94-48f5-9124-46710c5f20eb","resolution":{"observed_at":"2026-08-06T13:48:14.614753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:14.225738Z","title":"Llana: Large language and nerf assistant","venue":null,"work_id":"1094e933-3748-4096-ba9c-559210da377d","year":2024},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:00.771850Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:76bfac883bc543eb8205e23fb70f7e1826fb7d3e71a3457c8f70d6d3012b987d","observation_id":"859c74ae-622a-44d6-ac40-5754879b1047","resolution":{"observed_at":"2026-08-06T13:48:14.356360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:13.962380Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":"1cda0db0-bc04-441f-b872-20647224f7b2","year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:00.863694Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:b87eabe00a2e69d38b4c09cb8be7482b26c74989c2b02e122fd314be3603dba5","observation_id":"49a81f53-61a3-430e-ad8c-099f512b945e","resolution":{"observed_at":"2026-08-06T13:48:14.077094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13843","last_updated":"2024-09-24T11:28:21Z","snapshot_observed_at":"2026-08-07T04:04:34.065888Z","submitted_at":"2023-03-24T07:37:09Z","title":"CompoNeRF: Text-guided Multi-object Compositional NeRF with Editable 3D Scene Layout","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13843","snapshot_observed_at":"2026-08-06T13:48:00.939274Z","title":"Componerf: Text-guided multi-object compositional nerf with editable 3d scene layout","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:00.939274Z"},"links":{"cited_paper":"/paper/2303.13843","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:ee7c18103558e023bcc91a1060e86e73f365dcdd58511cc8537f89c385388966","observation_id":"48de0090-5227-4d2e-bdf0-c66f75c7874f","resolution":{"observed_at":"2026-08-06T13:48:00.939274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:13.814742Z","title":"Connecting nerfs images and text","venue":null,"work_id":"516e0717-188d-459f-a092-5fe101fe851d","year":2024},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:01.003325Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:65dfd3ec294b13576aa0d05b8927a5fd4b6383a031d22b89c596aa13900fbf9f","observation_id":"a5a0aff7-ee4b-4aac-8dd4-51cc63de8dbc","resolution":{"observed_at":"2026-08-06T13:48:13.890929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01140","last_updated":"2024-01-30T11:02:30Z","snapshot_observed_at":"2026-08-08T23:15:31.733582Z","submitted_at":"2023-10-02T12:27:22Z","title":"Neural Processing of Tri-Plane Hybrid Neural Fields","version":3},"cited_work":{"arxiv_id":"2310.01140","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.01140","snapshot_observed_at":"2026-08-06T13:48:06.673495Z","title":"Neural Processing of Tri-Plane Hybrid Neural Fields","venue":"cs.CV","work_id":"aaccb776-bde9-468e-9e95-cde7b87987a5","year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:01.072728Z"},"links":{"cited_paper":"/paper/2310.01140","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:e2dc6d4f3c36dbad9d4c3b2e8d8ca0546631411a0c41fbafb5b1e92b963c8d82","observation_id":"55ebde29-211c-475b-8f50-c6dcd892dc9c","resolution":{"observed_at":"2026-08-06T13:48:06.723178Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03012","last_updated":"2015-12-09T19:42:48Z","snapshot_observed_at":"2026-08-07T11:28:03.211074Z","submitted_at":"2015-12-09T19:42:48Z","title":"ShapeNet: An Information-Rich 3D Model Repository","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03012","snapshot_observed_at":"2026-08-06T13:48:01.163710Z","title":"Shapenet: An information-rich 3d model repository","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:01.163710Z"},"links":{"cited_paper":"/paper/1512.03012","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:653301fd2b2d02b25b70196ea2cc31f0bf4998fb127e85472e2682ee76e3ab8e","observation_id":"e9faa312-f256-4234-ba8a-60dc2e4e8714","resolution":{"observed_at":"2026-08-06T13:48:01.163710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:13.585821Z","title":"Tensorf: Tensorial radiance fields","venue":null,"work_id":"0de79c45-6c0b-4039-b7e8-49d653144bc2","year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:01.279694Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:93d1bbed678b64b59d656b6bab7117523a57ce478255bd4cf803b27f1b08e303","observation_id":"cd0eecff-d970-49c6-aabd-b21a89877cfd","resolution":{"observed_at":"2026-08-06T13:48:13.652976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:13.414318Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":"ced609bb-0219-4fbc-9904-43be8b595346","year":2020},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:01.369319Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:f4e88e0e9d3368d9816bea4e15b854f66abbc5b104f1432f68b0e2e50a1232d1","observation_id":"00532071-50f2-4488-8960-5bd6eb9173f0","resolution":{"observed_at":"2026-08-06T13:48:13.481865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-08-06T13:48:01.473477Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:01.473477Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:780f1c6ff7e96785328dc051ee8a8e673accba53ce3bef73087bfe1114ba6baa","observation_id":"73726ca9-4546-48a2-8657-49909d9a5b56","resolution":{"observed_at":"2026-08-06T13:48:01.473477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-06T13:48:01.574668Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:01.574668Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:9b07cc5bb313446b29fdb7d3edfa4a0e411a2df32b46a95109237a27eb7f7a32","observation_id":"727cc961-4c35-487d-a8bf-dac8ce28af14","resolution":{"observed_at":"2026-08-06T13:48:01.574668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:13.106749Z","title":"Language conditioned spatial relation reasoning for 3d object grounding","venue":null,"work_id":"564ea699-b5bc-4b29-a4a1-4a4c8a64342e","year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:01.692980Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:5050415ee743e00d1e9d4b763298d9da84e2e84575fa980dd10fb4c0f25538dd","observation_id":"dd635596-703e-4a63-891b-c16b2191c493","resolution":{"observed_at":"2026-08-06T13:48:13.212722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13083","last_updated":"2021-10-25T16:23:25Z","snapshot_observed_at":"2026-08-08T23:14:13.700995Z","submitted_at":"2021-10-25T16:23:25Z","title":"MVT: Multi-view Vision Transformer for 3D Object Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.13083","snapshot_observed_at":"2026-08-06T13:48:01.770602Z","title":"Mvt: Multi-view vision transformer for 3d object recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:01.770602Z"},"links":{"cited_paper":"/paper/2110.13083","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:b41ae9db93a7e4632252e56ede2378f816e6255a94de953cf4e86bf276161bb2","observation_id":"a794db84-808c-4359-958e-c65bedd801ef","resolution":{"observed_at":"2026-08-06T13:48:01.770602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:12.817424Z","title":"End-to-end 3d dense captioning with vote2cap-detr","venue":null,"work_id":"b58af788-0d8c-41a9-9521-85ec9b899d3a","year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:01.848099Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:fd842d965c0a619b0c10e0a7fcef89d78bb9e47fdacb0730e1aa3341adeedcf9","observation_id":"55d7e0a5-0106-4e12-834e-ce23aca332a4","resolution":{"observed_at":"2026-08-06T13:48:12.970121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:12.593494Z","title":"V ote2cap-detr++: Decoupling localization and describing for end-to-end 3d dense captioning","venue":null,"work_id":"4736397d-c92a-4920-9377-1e95bdb461b8","year":2024},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:01.891419Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:6d08f35cf812038a393e117c3124781af7ca3b44885cdfea2e082e8bdad20134","observation_id":"82fc555f-bfa3-451f-8a38-164ed370c518","resolution":{"observed_at":"2026-08-06T13:48:12.694743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:12.300038Z","title":"Scan2cap: Context-aware dense captioning in rgb-d scans","venue":null,"work_id":"ae70dd5d-73c2-427d-8ffc-54b67e10ee97","year":2021},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:01.992505Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:1e4effc80d1ac430e69b83c509d8f7f5af7f1be54ce6ad494749a4b83d4bf29f","observation_id":"e1446d83-51db-4fcf-a3b8-66c076d2442c","resolution":{"observed_at":"2026-08-06T13:48:12.439190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:02.079180Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:02.079180Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:e79477281d4fb5146b5f9e94306b52255b908b69f0657c6e9f30f358c70e8d68","observation_id":"d6765e62-af05-47a1-9011-d774999b51dd","resolution":{"observed_at":"2026-08-06T13:48:02.079180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:02.159298Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:02.159298Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:79d9f8300d035ac58ca103e56bd3c55ce8ff75f3ab8f1810450146eae4bee8b5","observation_id":"af419120-34fd-4192-a135-a411acd978fb","resolution":{"observed_at":"2026-08-06T13:48:02.159298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:12.120542Z","title":"4d spatio-temporal convnets: Minkowski convolutional neural networks","venue":null,"work_id":"80d0ed03-305a-4ef3-9842-2958358422f4","year":2019},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:02.221622Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:c8573afbe38e5e5d57e530ff5821444f35963b8da233d6027d670700678aba8a","observation_id":"065b0130-dd3d-409c-a974-e36d59ad6895","resolution":{"observed_at":"2026-08-06T13:48:12.204744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:02.293828Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:02.293828Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:8ec63d4ef49848451939827f85d54aea07c9310a7bcedafcf75da4e8828cca77","observation_id":"cd05eb91-d402-4192-a399-1bf84ed228f3","resolution":{"observed_at":"2026-08-06T13:48:02.293828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05438","last_updated":"2023-02-10T18:55:49Z","snapshot_observed_at":"2026-08-08T23:14:55.420763Z","submitted_at":"2023-02-10T18:55:49Z","title":"Deep Learning on Implicit Neural Representations of Shapes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05438","snapshot_observed_at":"2026-08-06T13:48:02.358997Z","title":"Deep learning on implicit neural representations of shapes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:02.358997Z"},"links":{"cited_paper":"/paper/2302.05438","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:e9e4a08aed9d0b2d486e8897a4e93eac9b80fdb1eeacc8dc52c9faffec82658e","observation_id":"9926460a-97ca-4bfd-a2bb-22b378356e87","resolution":{"observed_at":"2026-08-06T13:48:02.358997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:11.883950Z","title":"Plenoxels: Radiance fields without neural networks","venue":null,"work_id":"46d0ff09-52e4-46b3-a43b-154a8dc2db67","year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:02.442410Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:2b384dc4e927f59b7e42a9f3acb4330b1177654bbc77465832872592dfae0f04","observation_id":"e5fda67a-8459-4d87-b922-00f8072cd5d5","resolution":{"observed_at":"2026-08-06T13:48:12.001115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:02.507765Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:02.507765Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:32c9b481ce366dbd9994b7146db4406ce8f57c9acef022e5f36abc0405d12a9d","observation_id":"b9e72428-3e69-451d-aee5-8c228bc6e688","resolution":{"observed_at":"2026-08-06T13:48:02.507765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.01307","last_updated":"2017-06-05T13:25:24Z","snapshot_observed_at":"2026-08-07T17:28:18.540810Z","submitted_at":"2017-06-05T13:25:24Z","title":"Submanifold Sparse Convolutional Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.01307","snapshot_observed_at":"2026-08-06T13:48:02.590072Z","title":"Submanifold sparse convolutional networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:02.590072Z"},"links":{"cited_paper":"/paper/1706.01307","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:4dec51ce6eac07aa7b1950bcf03ab6331506d1cad9a5b62316531dd5d48a4b87","observation_id":"feff426a-774c-4815-9685-3b213ec08e13","resolution":{"observed_at":"2026-08-06T13:48:02.590072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-08T23:14:57.166208Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-06T13:48:02.658757Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:02.658757Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:9a87c1be8e2313a349f5b1481489e432c230ae0fc1c75336a08c7cf9dcbb1f47","observation_id":"cb278c4f-bce7-469a-87bf-a312ab79e322","resolution":{"observed_at":"2026-08-06T13:48:02.658757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03905","last_updated":"2023-09-11T20:25:16Z","snapshot_observed_at":"2026-08-08T23:15:31.134799Z","submitted_at":"2023-09-07T17:59:45Z","title":"ImageBind-LLM: Multi-modality Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03905","snapshot_observed_at":"2026-08-06T13:48:02.757425Z","title":"Imagebind-llm: Multi-modality instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:02.757425Z"},"links":{"cited_paper":"/paper/2309.03905","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:dd4817a6391d3951446d09af87b4352cbae67865eac597164c7fd053d5ccd9ca","observation_id":"d2973317-16b8-4964-b73f-f263517d2860","resolution":{"observed_at":"2026-08-06T13:48:02.757425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:02.816058Z","title":"3d-llm: Injecting the 3d world into large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:02.816058Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:f42a5498d7f9643e837b8d2d51a55b2c4b0a7948d91ba00571f461625fb0a0f9","observation_id":"ca87ad9f-727f-4812-bd8e-5e505887a124","resolution":{"observed_at":"2026-08-06T13:48:02.816058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:11.568554Z","title":"Unlocking textual and visual wisdom: Open-vocabulary 3d object detection enhanced by comprehensive guidance from text and image","venue":null,"work_id":"01ebf943-02c1-46eb-8e76-756da1c4daf1","year":2024},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:02.907456Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:a98d7067a35be9bf1f664fcf76d5e3efb215f0b77e15cdf117e9e830aec0d688","observation_id":"d914a6a7-9378-490b-9cf8-88bbbce0b9ff","resolution":{"observed_at":"2026-08-06T13:48:11.700595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:11.166481Z","title":"Cg-nerf: Conditional generative neural radiance fields for 3d-aware image synthesis","venue":null,"work_id":"42827f9a-4972-4cf8-a5a3-1dfe0d1839b7","year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:02.982517Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:c4c3783a933d409c627c7ead88563bf031940bb1b33571655d810dad7e74d27c","observation_id":"d71c5897-53fa-4b90-9a72-fa17546ffe10","resolution":{"observed_at":"2026-08-06T13:48:11.411758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:03.089857Z","title":"Lerf: Language embedded radiance fields","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:03.089857Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:64d0ab2d4f708cd91c6ba92ae4f950242703afaef0113c9048f8871f5f5cf14d","observation_id":"95bd0d92-258c-4530-b5ef-fa2ef0bf7a2a","resolution":{"observed_at":"2026-08-06T13:48:03.089857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:10.987878Z","title":"Parameter prediction for unseen deep architectures","venue":null,"work_id":"6872f721-749c-4678-9bc4-e6570b3c2fad","year":2021},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:03.146553Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:3a761b8df8c5817c6ae3582249b090a229aaf9cd97504170fac85007eb979ffd","observation_id":"dc9dc57e-ee69-4c7c-b0ed-9d020a56507b","resolution":{"observed_at":"2026-08-06T13:48:11.074926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:10.748297Z","title":"Decomposing nerf for editing via feature field distillation","venue":null,"work_id":"e4d149b1-07e5-45df-b091-ad215ea7e33d","year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:03.232106Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:5be527d6de57a057a9d565377f1c415daded35d53000ad0705670edb0d2a3122","observation_id":"dd5eacd8-8f49-4559-ad18-2ec9140bc9e4","resolution":{"observed_at":"2026-08-06T13:48:10.848571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:03.295549Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:03.295549Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:857809b47d181cfb052a5af3adb5d046de6a2b225b1b7b6081cf35af73f368a8","observation_id":"4fa7979e-e56e-433e-b381-8c28eef6ed37","resolution":{"observed_at":"2026-08-06T13:48:03.295549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:03.448698Z","title":"Visual instruction tuning.Advances in neural information processing systems , 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:03.448698Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:fa19085ede57f48a681f91b465a9c228ac78645481cc70d7be562ad55b2d5f57","observation_id":"bc8b862d-b2c8-4184-be75-ca34c3a74c6d","resolution":{"observed_at":"2026-08-06T13:48:03.448698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-07-06T14:05:02.813765Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-06T13:48:03.529117Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:03.529117Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:7460aa0394ccc6b91895474e9f1a38be280aec3240d3cf763702af7e8551b2da","observation_id":"6fe358d8-c9ab-4143-9eb9-a6092229c0b9","resolution":{"observed_at":"2026-08-06T13:48:03.529117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:10.600346Z","title":"Latent-nerf for shape-guided generation of 3d shapes and textures","venue":null,"work_id":"b629f73d-795c-4290-bc73-0b8136c50cf6","year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:03.611561Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:8b888e9b8b5382f22d9df93e81bef0663765029aa07cb58953c8f253f8ed4c87","observation_id":"ed082235-5ada-49a8-b6ce-4448fc336630","resolution":{"observed_at":"2026-08-06T13:48:10.648473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:03.693150Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:03.693150Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:06afcf9b7cb2b3158f07129633df104802871310f9ddc6e125dc6440b0746a47","observation_id":"0ab68ad0-8ce8-4a2e-8744-6d0a94f2a2de","resolution":{"observed_at":"2026-08-06T13:48:03.693150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:10.332127Z","title":"Reference-guided controllable inpainting of neural radiance fields","venue":null,"work_id":"25f2fda8-eeef-4938-a403-7944d83fe38b","year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:03.827743Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:d296b40e5ab7e8a7abe10b0a93dac4bb4d392fd310ffaa55d6bb9ada7c2e46fe","observation_id":"03f8bf14-fc30-4bc0-ae0a-4347db1d2674","resolution":{"observed_at":"2026-08-06T13:48:10.418059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:10.091331Z","title":"Instant neural graphics primitives with a multiresolution hash encoding","venue":null,"work_id":"1256cf25-4554-45ae-aeea-0c3494622aa6","year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:03.944069Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:400dab8526add1fe34a1888e6c12b5d0a09317adeff98db7ed15c93c5c507577","observation_id":"9c1c88e3-d0f9-4d2b-b417-f781fc681767","resolution":{"observed_at":"2026-08-06T13:48:10.270091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:09.872324Z","title":"Equivariant architectures for learning in deep weight spaces","venue":null,"work_id":"0a5f2174-df0c-42a8-94bd-bf166f29033e","year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:04.043245Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:68bb1628f13c986d7c90f62cd0da2d9ce324a9963b2afee65f9263a02cd02295","observation_id":"9bc5e0dc-e54a-4875-b7d5-06c7b83c3145","resolution":{"observed_at":"2026-08-06T13:48:09.985271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:04.154064Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:04.154064Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:0f91d0a1447d63ef573b7c921170fcb5fb446e7a309a7b6f9c77f53bd696aefa","observation_id":"15e8539a-c6ac-4045-ad6e-c6a8c7bd55f3","resolution":{"observed_at":"2026-08-06T13:48:04.154064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:09.567118Z","title":"Masked autoencoders for point cloud self-supervised learning","venue":null,"work_id":"395d8818-4454-44fb-a22a-4fd4c2fd987f","year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:04.258152Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:cd7ef185e99fff2ec3133c8b57ab9764d8e96363fbe7c390cc0959538159224b","observation_id":"84b6e44b-455f-48fc-91fa-e73a312161cd","resolution":{"observed_at":"2026-08-06T13:48:09.688603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:09.390889Z","title":"Clip-guided vision-language pre-training for question answering in 3d scenes","venue":null,"work_id":"c3a3fce9-1d68-4a8c-af1b-a153fdc0691f","year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:04.375622Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:0ef063c2411ae69cab5b1b1ce42a9c044316442d333a5d862563d3e6291ef87e","observation_id":"aaaaf3dd-d9ab-4154-806c-bc80019219c5","resolution":{"observed_at":"2026-08-06T13:48:09.476881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:09.181914Z","title":"Pointnet: Deep learning on point sets for 3d classification and segmentation","venue":null,"work_id":"4ed8fb55-3b8e-444d-bb80-cfc9af7f5359","year":2017},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:04.457692Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:cb444efd5f2800670441321ad4a29c75aaf12217cf0f7cc05a3618f3e07a0d1d","observation_id":"c595a8dd-67a0-4e6b-b0e5-2e043fbe2b37","resolution":{"observed_at":"2026-08-06T13:48:09.286251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:04.572299Z","title":"Pointnet++: Deep hierarchical feature learning on point sets in a metric space","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:04.572299Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:8b6ee36cacf138fe93ef4f86b0e2c8c5fe12e108d6966f13137c5c77d55dcb0e","observation_id":"4ef90906-4887-4eca-b3ee-c40f8caca8e1","resolution":{"observed_at":"2026-08-06T13:48:04.572299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:09.116217Z","title":"Gpt4point: A unified framework for point-language understanding and generation","venue":null,"work_id":"57809789-da50-407e-8785-548e50543f80","year":2024},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:04.654947Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:44f548b1f1c5ec1dfde56894ce1fbb227a0bbef62759eec31cee038b33f58824","observation_id":"7d5414bd-801c-4c3a-965a-656b6cab5d4f","resolution":{"observed_at":"2026-08-06T13:48:09.172978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:04.733648Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:04.733648Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:767aaac8a2e6d32324f35d16ec5f52677ae0de67829bf2654bd991319fe1ce04","observation_id":"f0555abe-8de2-4fe9-bd2f-5259c254993f","resolution":{"observed_at":"2026-08-06T13:48:04.733648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:04.824771Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:04.824771Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:db15762127cfd534f8962b79e70c2074eb8cf37c84a30164d6a45e3664cb6712","observation_id":"7f1f3255-25a4-409f-b8db-ad2aada69b32","resolution":{"observed_at":"2026-08-06T13:48:04.824771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:08.964937Z","title":"Deep learning on 3d neural fields","venue":null,"work_id":"997daab4-1a4b-4b56-9986-a8c3d3de4e91","year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:04.878956Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:e4994bc388048b4e92eae1479c160c275065898737399cdaf855779305164a7d","observation_id":"aaafabc3-ada5-4583-a0c4-3fa7d65fcc89","resolution":{"observed_at":"2026-08-06T13:48:09.021935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:08.823168Z","title":"Self-supervised representation learning on neural network weights for model characteristic prediction","venue":null,"work_id":"eab06c66-8de0-474e-9ff7-a9494095371c","year":2021},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:04.976553Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:9fececb25a17a8e50180117792507661a019f7aac18e642116450ef545431ca7","observation_id":"f5cff35a-9bd2-4f52-b085-9c7540cc7b53","resolution":{"observed_at":"2026-08-06T13:48:08.884051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:08.591810Z","title":"Hyp-nerf: Learning improved nerf priors using a hypernetwork","venue":null,"work_id":"ed3e8308-c352-4820-9253-dd7f89b00893","year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:05.036929Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:89048c06400320ee2a4aed0192894b8e0eb7fab6e5e4b414125b100b1bd85d66","observation_id":"05ddafe5-0fd2-4c7e-a577-807a5d1a5299","resolution":{"observed_at":"2026-08-06T13:48:08.684422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02827","last_updated":"2023-04-06T02:27:22Z","snapshot_observed_at":"2026-08-08T23:14:56.107384Z","submitted_at":"2023-04-06T02:27:22Z","title":"DITTO-NeRF: Diffusion-based Iterative Text To Omni-directional 3D Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02827","snapshot_observed_at":"2026-08-06T13:48:05.108713Z","title":"Ditto-nerf: Diffusion-based iterative text to omni-directional 3d model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:05.108713Z"},"links":{"cited_paper":"/paper/2304.02827","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:bcb573a12ff892aec4a75d7898671516b0bad4469d8decd234866dcece46ed83","observation_id":"c7584855-5479-456e-bce9-44e78b81a67b","resolution":{"observed_at":"2026-08-06T13:48:05.108713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:08.443414Z","title":"Direct voxel grid optimization: Super-fast convergence for radiance fields reconstruction","venue":null,"work_id":"70c6102c-201b-4d55-9999-fca70cb723c4","year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:05.219841Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:aaa486170f9d9833cc65a579f1a97382ce3468e2db3d8f160bc3fc684cd0c87e","observation_id":"2da05fd7-dc3e-405a-9a4d-542bcf4e24e0","resolution":{"observed_at":"2026-08-06T13:48:08.521012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:08.267327Z","title":"Nerfeditor: Differentiable style decomposition for 3d scene editing","venue":null,"work_id":"bca101a4-ca77-4427-bf40-f4eaee9cfda4","year":2024},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:05.281748Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:55709b8f76e12152b538c54a487a626f1c1ae43b60ff052a4d36b21ce64bc3d1","observation_id":"8d1602de-0b8a-4ce9-932f-42e1e4f763ba","resolution":{"observed_at":"2026-08-06T13:48:08.354300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T13:48:05.330695Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:05.330695Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:684419b833c2ff81c5dedd6eafd675ba0e5a606db1c7012b75f75c23558244e4","observation_id":"c26e365b-d88e-4c53-a69c-b6714aff5e66","resolution":{"observed_at":"2026-08-06T13:48:05.330695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.11448","last_updated":"2021-04-09T10:38:15Z","snapshot_observed_at":"2026-08-08T07:42:09.120294Z","submitted_at":"2020-02-26T13:06:14Z","title":"Predicting Neural Network Accuracy from Weights","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.11448","snapshot_observed_at":"2026-08-06T13:48:05.407676Z","title":"Predicting neural network accuracy from weights","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:05.407676Z"},"links":{"cited_paper":"/paper/2002.11448","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:3e9f99878c0226f21c246b129223e75838519b595a238c8efcdc2a4c90ef1da8","observation_id":"7ab09c0b-a41a-48e8-8a2b-cbebe2789cee","resolution":{"observed_at":"2026-08-06T13:48:05.407676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:08.101941Z","title":"Nerf-art: Text-driven neural radiance fields stylization","venue":null,"work_id":"e09f21d2-08c8-4d44-88ac-13f94253384c","year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:05.468093Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:6d032e3f33e442851efb320491f4593ca6d51d95969bae1f829ff96a5d2c2165","observation_id":"eb4e30a1-0393-473c-82ee-5b520211aa20","resolution":{"observed_at":"2026-08-06T13:48:08.173686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:07.929329Z","title":"Sparsenerf: Distilling depth ranking for few-shot novel view synthesis","venue":null,"work_id":"e4f5e012-e0a7-4aec-a6d8-69fbf6466c46","year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:05.572795Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:2a0f2cf1538d2b510758ef12779a72f25a82296b5496c4e6f0a6e689828777ea","observation_id":"c31f8e96-e0b5-4c36-90b5-40368345e440","resolution":{"observed_at":"2026-08-06T13:48:08.035248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.13298","last_updated":"2023-03-02T04:54:00Z","snapshot_observed_at":"2026-08-08T23:14:54.385932Z","submitted_at":"2022-07-27T05:09:54Z","title":"Is Attention All That NeRF Needs?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.13298","snapshot_observed_at":"2026-08-06T13:48:05.618712Z","title":"Is attention all that nerf needs? arXiv preprint arXiv:2207.13298, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:05.618712Z"},"links":{"cited_paper":"/paper/2207.13298","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:1fcc589740398fe21ed64dac79de6e5e2d27ac4d0935eb990fa685f76e159e38","observation_id":"a28ae1b7-f897-400a-b58d-e9bba72b171f","resolution":{"observed_at":"2026-08-06T13:48:05.618712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:07.800946Z","title":"Dynamic graph cnn for learning on point clouds","venue":null,"work_id":"b2355c47-fd54-439d-93c9-2450bdf594a6","year":2019},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:05.692671Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:dedba068080d76d03bab6b44fd6180563b0fcc2c49297d22a5019e7c40387b9c","observation_id":"e300df26-04ea-4ae6-bf17-4223e3601067","resolution":{"observed_at":"2026-08-06T13:48:07.858689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-06T13:48:05.768385Z","title":"Finetuned language models are zero-shot learners","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:05.768385Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:7f51865c06e9dfcf82b1c1cbbd7292057aded931b607aeadb64d5bd8ef19771f","observation_id":"e9f58a95-666a-48b2-a049-35d35c33e215","resolution":{"observed_at":"2026-08-06T13:48:05.768385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:05.820539Z","title":"Pointllm: Empowering large language models to understand point clouds","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:05.820539Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:b748e8aa20e7fa4af09af8791bbc65b1df64af8ddeaefb569596146b8e08501d","observation_id":"b478d53e-5480-4da5-990a-df037edf46ed","resolution":{"observed_at":"2026-08-06T13:48:05.820539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:07.665270Z","title":"Ulip: Learning a unified representation of language, images, and point clouds for 3d understanding","venue":null,"work_id":"25fca249-9eaf-4e57-a1e9-197d3b0cfd63","year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:05.907856Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:41e6dda0ad8d19794bd3429a408f9fa5aa40554fd457618591c6490a5c083cff","observation_id":"77673273-a29c-48a8-8cc6-4ad89b536166","resolution":{"observed_at":"2026-08-06T13:48:07.719762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:05.963623Z","title":"Ulip-2: Towards scalable multimodal pre-training for 3d understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:05.963623Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:a2a6d329881357628cae66c8a2834f9514c4c0a0f253eaf247c6b09cf711675d","observation_id":"cc5f76cf-c860-463d-83c8-058c219d105a","resolution":{"observed_at":"2026-08-06T13:48:05.963623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:07.514517Z","title":"3d question answering","venue":null,"work_id":"000136e5-e466-40ec-aa3e-9577e8f846cc","year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:06.031130Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:7caba80535ec211f1ee1840270849bb42160ebc85ae55789299af738d485c4c4","observation_id":"3033ed8b-c1f1-48f7-9586-27403ce950e1","resolution":{"observed_at":"2026-08-06T13:48:07.607741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:07.375492Z","title":"Point-bert: Pre-training 3d point cloud transformers with masked point modeling","venue":null,"work_id":"3031a073-aa86-4419-913a-722c80645ce7","year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:06.098632Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:86126f64413d50db761f7a622a3b4b96e3de6b286b777da95b827c6a0a7ed7f9","observation_id":"519ceebc-6da5-49eb-a4ce-2838b03b8532","resolution":{"observed_at":"2026-08-06T13:48:07.431484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:07.245377Z","title":"X-trans2cap: Cross-modal knowledge transfer using transformer for 3d dense captioning","venue":null,"work_id":"ab3da7f3-1465-4896-a938-82a6266e5517","year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:06.200728Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:a52992dce4901149469abe40ca72ff6e0888152801aaf100959f80c0ac6d2b20","observation_id":"7dd928f8-0435-4871-bd4e-afac0d0200df","resolution":{"observed_at":"2026-08-06T13:48:07.306267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-06T13:48:06.283815Z","title":"Llama-adapter: Efficient fine-tuning of language models with zero-init attention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:06.283815Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:be7efbcfe887ca2faab5d9e9ad0bdf093200ed76eef180b9829c3ce4cf7ad196","observation_id":"784c7428-fff6-409c-9438-38c5d308cb57","resolution":{"observed_at":"2026-08-06T13:48:06.283815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:07.042234Z","title":"Multi3drefer: Grounding text description to multiple 3d objects","venue":null,"work_id":"7b1d94a9-b95c-4e67-b5ac-2dd467db4746","year":2023},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:06.345597Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:88c3691df1d42f8da977542a09bae5818d704141688146f3164b32b6ec7c28d9","observation_id":"9aba2e05-f1e7-4d15-a6cb-3153795430b5","resolution":{"observed_at":"2026-08-06T13:48:07.168973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:48:06.869839Z","title":"Toward explainable 3d grounded visual question answering: A new bench- mark and strong baseline","venue":null,"work_id":"87aa8d8c-8541-45db-88ab-13174ae78b09","year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:06.435172Z"},"links":{"citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:909e58dcd563cc3346c5ebf9853f0e47412e02c2c1950a26076542daca72c225","observation_id":"b311e841-d93d-4903-8c7a-c1aef28fea23","resolution":{"observed_at":"2026-08-06T13:48:06.944632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":1,"verified_fuzzy":39},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 1 inbound Pith citation observation for arXiv:2507.20110."}