{"as_of":"2026-08-09T01:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3c8488e00293fa9ab00c2312800bfda402f76061e5f9aabda87f1fdf5c9aec58","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T19:22:04.169020Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2512.01008/citation-record","integrity":"/paper/2512.01008/integrity","json":"/paper/2512.01008/citation-record.json","paper":"/paper/2512.01008"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:22:04.068354Z","title":"ReferIt3D: Neural Listen- ers for Fine-Grained 3D Object Identification in Real-World Scenes","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.068354Z"},"links":{"citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:968a67df68929e4a61f2d7a8c47a669246ceab69145f8e011d0669b690e51ae5","observation_id":"ee625a1d-d930-4b74-9f6f-9b4ed33aef11","resolution":{"observed_at":"2026-08-03T19:22:04.068354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:22:04.073150Z","title":"Qwen2.5-VL Technical Report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.073150Z"},"links":{"citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:258cecda8190d49a8be24b12d8d3ceade21e6b19f83331adef980d8a05738be2","observation_id":"59d774a7-62da-4978-9f45-16185531320c","resolution":{"observed_at":"2026-08-03T19:22:04.073150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:22:04.076635Z","title":"From thousands to billions: 3d visual language ground- ing via render-supervised distillation from 2d VLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.076635Z"},"links":{"citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:b1c1e77c904d700911aa8821c76cc7729f9fb3c4b6f1ba8e67d696345c47ca82","observation_id":"e9d708dc-b5f9-4f7c-867a-d211eaae0c0b","resolution":{"observed_at":"2026-08-03T19:22:04.076635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:22:04.080543Z","title":"SAM 3: Segment Anything with Concepts, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.080543Z"},"links":{"citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:a57ba372165a607dae891c55af0d538ec487ce870ea43bdb87db46fa8daa4149","observation_id":"1f688f06-5710-4471-828a-053e172b4c09","resolution":{"observed_at":"2026-08-03T19:22:04.080543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:22:04.084353Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.084353Z"},"links":{"citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:be6c54734a1d554f257a81cb83f33970a64dd945073651b9fd81aff7efe01921","observation_id":"6ed007e5-8c81-49ac-adc2-f42b51050920","resolution":{"observed_at":"2026-08-03T19:22:04.084353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:22:04.088236Z","title":"Sdfusion: Multimodal 3d shape completion, reconstruction, and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.088236Z"},"links":{"citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:18d43aa3a17477cff50144791379e5b67df2bce64a8a670c8532efeadeb6bfb1","observation_id":"9bb644bd-eed4-4f30-a43a-53a1277142c0","resolution":{"observed_at":"2026-08-03T19:22:04.088236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:22:04.092329Z","title":"Lam3d: Large image-point clouds align- ment model for 3d reconstruction from single image.Ad- vances in Neural Information Processing Systems, 37:4454– 4480, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.092329Z"},"links":{"citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:17b0266f4008f0f138882a465a45349d608871e00554be5a9fb7f5c7f515909d","observation_id":"cc2bb181-470e-4cfa-8d68-c55480adc5a8","resolution":{"observed_at":"2026-08-03T19:22:04.092329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:22:04.095972Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.095972Z"},"links":{"citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:e9f28c14d35aad565bca9ccc5d3e43566822a15097a65de64c3eea9add238daa","observation_id":"f447d6a5-bab7-42b5-b350-ff14773c9387","resolution":{"observed_at":"2026-08-03T19:22:04.095972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:22:04.099573Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.099573Z"},"links":{"citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:41e14025f5bd60b509e9abcf87864d9dd6f5c5760da4c58b0e16e0449ee4280c","observation_id":"99c161c3-e72b-4eaf-a6b1-ce0fddbfbc87","resolution":{"observed_at":"2026-08-03T19:22:04.099573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:22:04.103070Z","title":"SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.103070Z"},"links":{"citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:b73de380dbc8f60007cf608465e2ef20dc4554d10fa766dbb5b8ade8c1c8c610","observation_id":"5ec97523-7de9-4617-9329-5c491c15786a","resolution":{"observed_at":"2026-08-03T19:22:04.103070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:22:04.107066Z","title":"3d gaussian splatting for real-time radiance field rendering.ACM Trans","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.107066Z"},"links":{"citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:8c7329719b40757bd1d2484792ed25f0b7960f86f035dd26a866d7815b2af08f","observation_id":"d2565d1d-0aab-4bf0-a4b1-d374143ef46d","resolution":{"observed_at":"2026-08-03T19:22:04.107066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:22:04.111126Z","title":"Berg, Wan-Yen Lo, Piotr Doll ´ar, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.111126Z"},"links":{"citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:56a47bf21ae3ba6eda8bfb1032838675086018bdf85ba5f3e7b814a0b4c335d4","observation_id":"143fcfd2-9e46-45a1-92cc-8e347d6e4ef9","resolution":{"observed_at":"2026-08-03T19:22:04.111126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:22:04.114579Z","title":"LISA: Reasoning Segmen- tation via Large Language Model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.114579Z"},"links":{"citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:680bc3f0c036d23703b6fef4fea820f867b95e2171bb75873916b69b872e5832","observation_id":"0c6be40f-b30c-41f9-9bb0-a6a6d6a64354","resolution":{"observed_at":"2026-08-03T19:22:04.114579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:22:04.117895Z","title":"Part123: part-aware 3d reconstruction from a single-view image","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.117895Z"},"links":{"citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:c601a863299c3c443f1574893917fad20fd1f79b1551aa6463bc360f82a6bec4","observation_id":"99dca848-b166-4097-a0a1-c8e8aa0820c1","resolution":{"observed_at":"2026-08-03T19:22:04.117895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:22:04.121349Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.121349Z"},"links":{"citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:3e3ab3dd8d29f9856f9c21c206e6416abfb34b8539ef452fe36cd35de808a75d","observation_id":"88db3e1a-84d6-4151-a57e-b0d6ae85998b","resolution":{"observed_at":"2026-08-03T19:22:04.121349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-03T19:22:04.125440Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.125440Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:c817b4ffe376ce7f924105c3e51d0148a90e47671a429d5d0da2add72897ce27","observation_id":"fd11c686-cc90-433f-a5e6-a0a8125de3d9","resolution":{"observed_at":"2026-08-03T19:22:04.125440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:22:04.129035Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.129035Z"},"links":{"citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:f7adefcb597fefbf5918278f8ace33952920ff663674794f76748d2d72139433","observation_id":"98f6dc14-9a7c-40ce-88c4-044f2359a9cf","resolution":{"observed_at":"2026-08-03T19:22:04.129035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:22:04.132279Z","title":"SAM 2: Segment Anything in Images and Videos,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.132279Z"},"links":{"citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:5a5e00d52c233cd877f99d3df0bdfa21ce6d25d3d561bdd4a7e65b0bda09aed6","observation_id":"59a19e38-e36d-4cc6-9bbe-5ded861c5608","resolution":{"observed_at":"2026-08-03T19:22:04.132279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:22:04.135636Z","title":"A survey of language-grounded mul- timodal 3d scene understanding.Knowledge-Based Systems, 321:113650, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.135636Z"},"links":{"citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:e0c921f85e7c4a6563f9b3e6ddc3507a254467a7e90b33ba355987df961c9e4f","observation_id":"1bcf6dc4-b341-4eeb-9ffe-29b565129a99","resolution":{"observed_at":"2026-08-03T19:22:04.135636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-03T19:22:04.138576Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks.arXiv preprint arXiv:2401.14159,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.138576Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:0ae4d6934fa231e71a673ae1f412075365094b94185f18488c8c1a8a1b0af1e7","observation_id":"1f29bdc8-0905-4165-94ac-ee4b37488acc","resolution":{"observed_at":"2026-08-03T19:22:04.138576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10261","last_updated":"2023-04-19T16:39:51Z","snapshot_observed_at":"2026-08-04T21:24:21.644542Z","submitted_at":"2023-04-19T16:39:51Z","title":"Anything-3D: Towards Single-view Anything Reconstruction in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10261","snapshot_observed_at":"2026-08-03T19:22:04.142399Z","title":"Anything- 3d: Towards single-view anything reconstruction in the wild","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.142399Z"},"links":{"cited_paper":"/paper/2304.10261","citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:1c307065f4f68b1742c881a81eaba9345288774ad89c33f0174749d504160dfa","observation_id":"2241c7dc-e393-4d51-b749-64b7fcaa0f37","resolution":{"observed_at":"2026-08-03T19:22:04.142399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:22:04.145796Z","title":"Point-gnn: Graph neural net- work for 3d object detection in a point cloud","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.145796Z"},"links":{"citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:d2ff3d35215764652a82964655ca818304d842da7bc58f30c4bbab9cb89ea65e","observation_id":"addd49e9-abbb-4e9a-9fe3-b4f0933fc794","resolution":{"observed_at":"2026-08-03T19:22:04.145796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:22:04.148641Z","title":"Splat-MOVER: Multi-Stage, Open- V ocabulary Robotic Manipulation via Editable Gaussian Splatting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.148641Z"},"links":{"citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:2c146cd26088d95b1dda0c6d335ad899b47264330fcd5eddd22ce39aca24fc5a","observation_id":"e89dc7f5-0491-427d-a054-7ffc7845727a","resolution":{"observed_at":"2026-08-03T19:22:04.148641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:22:04.151842Z","title":"Natural Language Guided Goals for Robotic Manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.151842Z"},"links":{"citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:478bce84d4a114fb9f1999b0d4066419536591cc551f882870af0f239e79c1d3","observation_id":"021f976c-f0b5-47ba-948b-2c75e928d469","resolution":{"observed_at":"2026-08-03T19:22:04.151842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:22:04.155120Z","title":"SAM 3D: 3Dfy Anything in Images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.155120Z"},"links":{"citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:5180c3cb92747292bfa9f625dcbe311bc02d26b5c8f81b9aa1b7e45b5915b8e3","observation_id":"e388a48c-70e8-48a6-94dd-43d8215c9c91","resolution":{"observed_at":"2026-08-03T19:22:04.155120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:22:04.159081Z","title":"Sa2V A: Marrying SAM2 with LLaV A for Dense Grounded Understanding of Images and Videos, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.159081Z"},"links":{"citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:9953c7d3d988d9f45da5c686aacfcef8e0d73caf523b898e027b84a5cd852f7b","observation_id":"01114c86-0576-4c11-9c4d-97d0a888b6b4","resolution":{"observed_at":"2026-08-03T19:22:04.159081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:22:04.162258Z","title":"Instancerefer: Cooperative holistic understanding for visual grounding on point clouds through instance multi-level contextual refer- ring","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.162258Z"},"links":{"citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:0ab61e6ae48daa2f6269bfa4b9fc13ed6f7e7b86b334c438dde3f8095a8a101b","observation_id":"4022fd66-06cf-4a6e-9034-bcf8553acea4","resolution":{"observed_at":"2026-08-03T19:22:04.162258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-05T20:54:58.855446Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-03T19:22:04.165316Z","title":"3D- VLA: A 3D Vision-Language-Action Generative World Model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.165316Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:750079ba5a306d01ae5619a1b7d9fa2eee004e9b9ea067e46b34fe7c08d76bcf","observation_id":"91e3baa7-afcb-44f5-84ed-f9500e5b0f16","resolution":{"observed_at":"2026-08-03T19:22:04.165316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:22:04.169020Z","title":"EditRoom: LLM-parameterized Graph Diffusion for Composable 3D Room Layout Editing,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.169020Z"},"links":{"citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:eaf9269dc9bd49419172de2edd05200b0efc32224288af5fa2c9826a116af26d","observation_id":"6d03deb5-8ba9-48af-8377-2da9c989cb31","resolution":{"observed_at":"2026-08-03T19:22:04.169020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T16:52:15.597114Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2512.01008."}