{"as_of":"2026-08-11T00:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:943fdc0b69ab12e9e0ad96a9754761869961ee289a180762a5f3ba4910d2545a","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:39:12.809687Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:46:14.473013Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T22:45:24.456612Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07819","snapshot_observed_at":"2026-08-07T13:46:14.473013Z","title":"3ur-llm: An end-to-end multimodal large language model for 3d scene understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-10T03:26:05.211596Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:14.473013Z"},"links":{"cited_paper":"/paper/2501.07819","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:88918384b6d3c4a3b2edfe915e45d3a78ec587b2005d372c1fd461095dcaa90c","observation_id":"58d23528-1edd-4483-a4f0-a17c2c013d05","resolution":{"observed_at":"2026-08-07T13:46:14.473013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07819","snapshot_observed_at":"2026-08-05T22:18:05.122134Z","title":"Yang, J.; Cen, J.; Peng, W.; Liu, F., Shuai amd Hong; Li, X.; Zhou, K.; Chen, Q.; and Liu, Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.07253","last_updated":"2025-08-10T09:12:29Z","snapshot_observed_at":"2026-08-08T15:34:10.323551Z","submitted_at":"2025-08-10T09:12:29Z","title":"PySeizure: A single machine learning classifier framework to detect seizures in diverse datasets","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T22:18:05.122134Z"},"links":{"cited_paper":"/paper/2501.07819","citing_paper":"/paper/2508.07253"},"observation_digest":"sha256:8097c2a08533689991e619fc867da8e09c785c216f74f6e28c85b9b8658e3b8c","observation_id":"8e4e8dc4-e183-471f-a647-449bd00eab2b","resolution":{"observed_at":"2026-08-05T22:18:05.122134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"cited_work":{"arxiv_id":"2501.07819","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07819","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3ur-llm: Unified understanding and reasoning for real 3d scenes with point clouds and language.arXiv preprint arXiv:2501.07819","venue":null,"work_id":"0e3136b1-26c8-4064-9c76-bc0f49bf0bc1","year":null},"citing_paper":{"arxiv_id":"2511.10946","last_updated":"2026-04-15T01:06:55Z","snapshot_observed_at":"2026-08-03T12:49:21.604140Z","submitted_at":"2025-11-14T04:16:09Z","title":"Abstract 3D Perception for Spatial Intelligence in Vision-Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-17T22:43:16.761970Z"},"links":{"cited_paper":"/paper/2501.07819","citing_paper":"/paper/2511.10946"},"observation_digest":"sha256:ed78ae3514a1d844f99deb190e39648faa4e0560760b6fdceaf2dfce56281678","observation_id":"cc07f7e3-e66e-40f2-bf53-9bebee77e807","resolution":{"observed_at":"2026-05-17T22:45:24.459884Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.07819/citation-record","integrity":"/paper/2501.07819/integrity","json":"/paper/2501.07819/citation-record.json","paper":"/paper/2501.07819"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.982217Z","title":"Chatgpt: Optimizing language models for dialogue,","venue":null,"work_id":"ec3892e7-de12-45bb-927c-1f1b44334acb","year":2022},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.460397Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:356f350319e7e68d497c08a9aba22dd66ed39e7f76a1149421d1224ae0da2955","observation_id":"86537c9f-e7a5-4eb3-9b3e-f488dcd4dcec","resolution":{"observed_at":"2026-08-10T20:39:13.987351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T20:39:12.465858Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.465858Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:cac3b0a0d3c500b8e8ebbc974e4585060e4b8b723fe464977e1a093bb25fa53c","observation_id":"9c87d6d7-194d-4d0b-bc4c-e48f9b4be5f9","resolution":{"observed_at":"2026-08-10T20:39:12.465858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T20:39:12.471078Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.471078Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:90b8a6e2bc49a9c23c3ee6f86bf098ab6294519387c15b619fd4b209afd704ed","observation_id":"4a7c1dc8-ba53-4303-b5b0-eb004f24549e","resolution":{"observed_at":"2026-08-10T20:39:12.471078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-10T20:39:12.477063Z","title":"Gemini: a family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.477063Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:972233382f0b30886b35e667aeafee43c7fc567c4e907b8c43f997925ab1b4ae","observation_id":"10c6979b-6176-466d-acbd-8629b503412b","resolution":{"observed_at":"2026-08-10T20:39:12.477063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.965133Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"aa468fcf-622f-48ff-bbe8-7c41ace4c736","year":2023},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.483252Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:0a12dbb2c757dada503326634fba860ee854d761dc94ee4ae3626eb371e3c200","observation_id":"00713a15-c5e2-4d3d-83c9-7a4288d67de6","resolution":{"observed_at":"2026-08-10T20:39:13.970572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-10T20:39:12.489257Z","title":"Openflamingo: An open-source framework for training large autoregressive vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.489257Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:919544ee30db7a38ef0358d19bfe8811ed5823021bd74c11cc80452d8804f294","observation_id":"4ce9ec64-8924-40b1-b6f9-e35cca63b96b","resolution":{"observed_at":"2026-08-10T20:39:12.489257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-10T20:39:12.495609Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.495609Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:98256975c3543f4147d3861cae55f8cba6eba3693e1e28888188a0ea89853aac","observation_id":"25316d5b-6cd3-4a81-9267-ad2b14393f95","resolution":{"observed_at":"2026-08-10T20:39:12.495609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18799","last_updated":"2024-09-09T16:00:04Z","snapshot_observed_at":"2026-08-10T13:10:52.625152Z","submitted_at":"2023-11-30T18:43:51Z","title":"X-InstructBLIP: A Framework for aligning X-Modal instruction-aware representations to LLMs and Emergent Cross-modal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18799","snapshot_observed_at":"2026-08-10T20:39:12.501353Z","title":"X-instructblip: A framework for aligning x-modal instruction-aware representations to llms and emergent cross- modal reasoning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.501353Z"},"links":{"cited_paper":"/paper/2311.18799","citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:e6c0e6fa4e197b17c60169d9a4a76e0e3f08e966fe2d9a530c9e094c2f10e638","observation_id":"54232287-b629-49b0-9e68-f757043a9a7e","resolution":{"observed_at":"2026-08-10T20:39:12.501353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.947754Z","title":"Scanqa: 3d question answering for spatial scene understanding,","venue":null,"work_id":"cc8dfbb4-38c7-46fa-84b5-2186b777deac","year":2022},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.506248Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:55efea232408271ef15a540443b862c2abf21abd36b70110e439081740463f75","observation_id":"882b9a20-4a37-4b81-b3f2-b8c0f70adf50","resolution":{"observed_at":"2026-08-10T20:39:13.953513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-07-06T14:05:02.813765Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-10T20:39:12.511670Z","title":"Sqa3d: Situated question answering in 3d scenes,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.511670Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:a40d2a779e39fac8c71bf821cf553515797262c540e1e2201289729959216bf2","observation_id":"a9548686-ba0b-4b81-b9d0-bb565b686606","resolution":{"observed_at":"2026-08-10T20:39:12.511670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-10T20:39:12.517167Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.517167Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:c3d5ece918d06b6ce05e514461ba480ef31393a75bb3d9d96f8e7201ada0cf26","observation_id":"0db83eb1-3ce6-41d2-bf9c-925ac1f187f3","resolution":{"observed_at":"2026-08-10T20:39:12.517167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.929651Z","title":"Deep hough voting for 3d object detection in point clouds,","venue":null,"work_id":"e80b7f72-02a5-4fbd-a459-8cfb6a2f080d","year":2019},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.522660Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:607f2b43f1e4a11494d0535f972cb71821f0a65ee8ab6456c31a4634581d4204","observation_id":"911bfe9a-57be-4a5c-8eda-440d9954f8d6","resolution":{"observed_at":"2026-08-10T20:39:13.935076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:12.527226Z","title":"3d-llm: Injecting the 3d world into large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.527226Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:e6266db7fff4633327a1ec4d144c81b0bc8c39b35c156fc06a3e25e7f04bbe8e","observation_id":"a4988914-e146-436c-984a-5b43be4ccc57","resolution":{"observed_at":"2026-08-10T20:39:12.527226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.901764Z","title":"Segment anything,","venue":null,"work_id":"fefb5e44-d836-4c7b-9672-7f8573779e84","year":2023},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.533751Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:ff8d1fb7dc8f6bbc35aa8e7356f866f43a7e771e7360e1817c3a3a84e5eb7a6e","observation_id":"ee3aac66-f8e7-40e5-8e73-9779bf3879af","resolution":{"observed_at":"2026-08-10T20:39:13.907356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.884250Z","title":"Masked-attention mask transformer for universal image segmentation,","venue":null,"work_id":"dc342e68-9a7c-4de4-af85-df881ad08149","year":2022},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.539498Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:3e355db8555214ad038247621a8b0462f9520f9087d2ea04cfb5783bee2096ba","observation_id":"75a1cecc-f363-4e4d-871c-366da6dbc5d8","resolution":{"observed_at":"2026-08-10T20:39:13.890127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:12.544476Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.544476Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:70f40ab7fdea83dab9812ce56f2f031e2246fce37b85d6fbe8143c600094002d","observation_id":"abb9dd29-7bf7-41cf-accf-bb0bdf76d39d","resolution":{"observed_at":"2026-08-10T20:39:12.544476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.854653Z","title":"An end-to-end transformer model for 3d object detection,","venue":null,"work_id":"22aa4193-76b2-4c69-876b-4210a973961e","year":2021},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.549839Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:b95a4facf763b2d372e9eb8b4b382630936dbe5491fc4a05522b285fe2e53de5","observation_id":"6e4a6011-888d-492b-9274-6208796adb90","resolution":{"observed_at":"2026-08-10T20:39:13.860073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.837980Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":"c3adc505-d9b5-432d-b029-882c0ae0dcbb","year":2022},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.555589Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:6b606800966229629d24e2c94ab725f7ad4774a719aadb39b87dbff511be0c77","observation_id":"67d4dd9f-7124-46bb-9445-7cb3bbb22906","resolution":{"observed_at":"2026-08-10T20:39:13.843023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:12.561196Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.561196Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:d63404c9af036b36c40be25b13a90cb7dc26f7a1ddd83e102a3146622b0d0698","observation_id":"40b8c5a7-a891-41b9-993e-4fe940c5c8e7","resolution":{"observed_at":"2026-08-10T20:39:12.561196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:12.566721Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.566721Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:a4a94d031c6e909a96a9978859d83d6fdb5f572b669ed40c9881431d1476e255","observation_id":"30ec9318-0d55-4ac6-94ed-7f53fb0d6833","resolution":{"observed_at":"2026-08-10T20:39:12.566721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.801423Z","title":"Rio: 3d object instance re-localization in changing indoor environments,","venue":null,"work_id":"cfee8c21-0851-4323-ae11-1364df7b4f28","year":2019},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.571422Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:3264d8fe59d6e7ddb47e0e33b066f9ba68f4aaf23fe7c3e421d43c364cb9d64f","observation_id":"76cad131-e458-4a6f-a361-83fd307fa6a0","resolution":{"observed_at":"2026-08-10T20:39:13.806435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.784332Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":"5bf29213-40ce-4dc2-9005-817907551e21","year":2020},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.576311Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:23f6f172c057b7b4bcceca0e4a2e48f8300ce680d3c44050b027416efa2a7d83","observation_id":"cc31d721-d77e-4517-a99e-e737e9b2a136","resolution":{"observed_at":"2026-08-10T20:39:13.790129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:12.581307Z","title":"Improving language understanding by generative pre-training,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.581307Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:a0e8e95b4c66a541b080fa7b1582b2036430e281542b8245989a4b176c8b388e","observation_id":"0ae896f7-fc7f-4c93-91e3-2cbb38a8dd87","resolution":{"observed_at":"2026-08-10T20:39:12.581307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:12.586551Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.586551Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:c808c0119481f1c3020b68fba489e996b341dbaaa0cd13d5ad3bbcdfb8f0ce0e","observation_id":"da4c0956-d103-42e3-9ca8-86c7b227b352","resolution":{"observed_at":"2026-08-10T20:39:12.586551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-10T20:39:12.591535Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.591535Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:d99fbcf222b6d5346b6c0c3110760bc9547aed6357a1e28b976e4fd0e928c909","observation_id":"f5dbffb5-a6f5-4d57-ad0f-4e15ee6b49e7","resolution":{"observed_at":"2026-08-10T20:39:12.591535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.746408Z","title":"Palm: Scaling IEEE TRANSACTIONS ON MULTIMEDIA 12 language modeling with pathways,","venue":null,"work_id":"9e7cb14b-40cc-4eb5-82e6-a3c17e810eaf","year":2023},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.596464Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:cc412961f775cb56bdecb352e353e8afca252f0c6189d4558a67e88950566508","observation_id":"cb4d0a92-6165-4aeb-9219-f20695ae9012","resolution":{"observed_at":"2026-08-10T20:39:13.751537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10305","last_updated":"2025-04-17T08:34:42Z","snapshot_observed_at":"2026-08-06T06:52:14.558389Z","submitted_at":"2023-09-19T04:13:22Z","title":"Baichuan 2: Open Large-scale Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10305","snapshot_observed_at":"2026-08-10T20:39:12.601023Z","title":"Baichuan 2: Open large-scale language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.601023Z"},"links":{"cited_paper":"/paper/2309.10305","citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:7ee5592483e7f910082328f682ceaa17cac7768fa0e4cd069e9c7d6c762445a3","observation_id":"1fd794bd-8bd1-4963-8aed-041f62183640","resolution":{"observed_at":"2026-08-10T20:39:12.601023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:12.607083Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.607083Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:f19ef417e4ff31dd337e4ed79279b0fb7c34b5bc73fb1d8af7fca7a692c1ab7b","observation_id":"1f536e8c-4164-41ed-8283-950e810934fa","resolution":{"observed_at":"2026-08-10T20:39:12.607083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-07-06T16:31:25.350087Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-10T20:39:12.612153Z","title":"Ferret: Refer and ground anything anywhere at any granularity,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.612153Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:172fefa4b022043c20164b9bbb618e778513f5bf60e43767f66620e831bef10e","observation_id":"caaab393-4c06-4497-b3f3-6061c181e667","resolution":{"observed_at":"2026-08-10T20:39:12.612153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03700","last_updated":"2025-01-09T09:12:06Z","snapshot_observed_at":"2026-08-04T10:20:08.342718Z","submitted_at":"2023-12-06T18:59:19Z","title":"OneLLM: One Framework to Align All Modalities with Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03700","snapshot_observed_at":"2026-08-10T20:39:12.617254Z","title":"Onellm: One framework to align all modalities with language,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.617254Z"},"links":{"cited_paper":"/paper/2312.03700","citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:48e3c1c4ac3e22379fd4f13e7bbcf7333498c6da01f1fe35dff2c8bfd104b98e","observation_id":"5c7cb602-e538-4525-b269-1e726bc37eeb","resolution":{"observed_at":"2026-08-10T20:39:12.617254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.720392Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language,","venue":null,"work_id":"b7810f06-e059-4fad-a9c3-4f1e933a141d","year":2020},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.621969Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:f3a477647e48f4ccc812caf878d77e1140dbdf05051f5270e65c6021db5366f5","observation_id":"c2b8a48b-ad0d-4ca3-bfdb-530e479272af","resolution":{"observed_at":"2026-08-10T20:39:13.725263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.703884Z","title":"Scan2cap: Context-aware dense captioning in rgb-d scans,","venue":null,"work_id":"e1335c75-cdbb-44ea-a4ba-20cb9dd4e312","year":2021},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.626561Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:089bba2e10c4e5f14ac27b84d55949e868bbbfd3332f7a8103719ba8549753dc","observation_id":"911dd5a4-4baf-46cb-b6c8-95473bfd0bbf","resolution":{"observed_at":"2026-08-10T20:39:13.709117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.686788Z","title":"Proposalcontrast: Unsupervised pre-training for lidar-based 3d object detection,","venue":null,"work_id":"46148cc3-2773-4756-b365-083cdb369eab","year":2022},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.631225Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:ff972599c71d6305ae5003a6a8c12d5122a4ccb32c6ec2a823eef753ab470779","observation_id":"c5b17490-9bf3-4fdb-a87a-868bbcd0b204","resolution":{"observed_at":"2026-08-10T20:39:13.692413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.669960Z","title":"Graph neural network and spatiotemporal transformer attention for 3d video object detection from point clouds,","venue":null,"work_id":"f69694fd-3059-4df6-a18c-4b750e0c119e","year":2021},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.636279Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:b7680406fd118fad9dc68042407ee78c960bb0c3c6936d4b74f686ae36cac649","observation_id":"6b07d920-cd08-4cb2-a785-23756e104843","resolution":{"observed_at":"2026-08-10T20:39:13.675655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.653444Z","title":"Is-fusion: Instance-scene collaborative fusion for multimodal 3d object detection,","venue":null,"work_id":"0613c1dd-8933-4a9c-9c3e-b2379153a3ab","year":2024},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.641014Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:b0232001309983c536de0267d8f42d99e460bf34dfba0ff86bda3c9c42499cdd","observation_id":"8a1fc6ef-ad7c-4e90-85ed-171f1f181541","resolution":{"observed_at":"2026-08-10T20:39:13.658802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.634870Z","title":"Lsk3dnet: Towards effective and efficient 3d perception with large sparse kernels,","venue":null,"work_id":"5c1d7c69-36bc-45ca-a35a-5142b3e01d9c","year":2024},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.645802Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:c5c73405bac4885d2da462f73c224dfcc4a1fe0c4e9909e5930af49ee3f4bd4e","observation_id":"5d0485a7-4762-46db-bb92-6ca5cd33ec80","resolution":{"observed_at":"2026-08-10T20:39:13.641281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10200","last_updated":"2024-07-14T13:42:05Z","snapshot_observed_at":"2026-08-10T16:02:47.348480Z","submitted_at":"2024-07-14T13:42:05Z","title":"Shape2Scene: 3D Scene Representation Learning Through Pre-training on Shape Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10200","snapshot_observed_at":"2026-08-10T20:39:12.650267Z","title":"Shape2scene: 3d scene rep- resentation learning through pre-training on shape data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.650267Z"},"links":{"cited_paper":"/paper/2407.10200","citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:64f31d17697f6884f26be611bafc7b1ffde10f2299c4fb0944fa6a5d5fe52fc6","observation_id":"8944b8aa-cb8d-408c-a235-f165081895d1","resolution":{"observed_at":"2026-08-10T20:39:12.650267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.616732Z","title":"Clustering based point cloud representation learning for 3d analysis,","venue":null,"work_id":"4e961b71-3b6f-4ddb-9911-71c25e9be73c","year":2023},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.655833Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:b1271f88ece51bc77badcf4564b6f2bf06a2ddd2b0db91d3bde3ede6b4023c34","observation_id":"fe59aff1-0f92-4177-867f-3237c083a435","resolution":{"observed_at":"2026-08-10T20:39:13.622864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.598051Z","title":"Weakly supervised 3d object detection from lidar point cloud,","venue":null,"work_id":"34cd8eec-88de-4d03-86be-5cc39787e50c","year":2020},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.660428Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:b19d7e0dda40a6ff07daafdc60349a78c0bc848d946857801d051a9fe4df1b7b","observation_id":"cf5e707a-e2e3-4ed6-8816-3c514a1cde6a","resolution":{"observed_at":"2026-08-10T20:39:13.603492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16911","last_updated":"2024-09-06T22:45:43Z","snapshot_observed_at":"2026-08-10T23:07:10.208283Z","submitted_at":"2023-08-31T17:59:46Z","title":"PointLLM: Empowering Large Language Models to Understand Point Clouds","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16911","snapshot_observed_at":"2026-08-10T20:39:12.665081Z","title":"Pointllm: Empowering large language models to understand point clouds,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.665081Z"},"links":{"cited_paper":"/paper/2308.16911","citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:0f3d3ca3daaa6553e5b8a6782974f0fcae5366b6f700cf04741301d87eed23cf","observation_id":"eb0cf1c9-3fa3-4b9b-9c30-52b079489d09","resolution":{"observed_at":"2026-08-10T20:39:12.665081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17766","last_updated":"2024-07-12T15:36:15Z","snapshot_observed_at":"2026-08-07T07:21:42.294215Z","submitted_at":"2024-02-27T18:57:12Z","title":"ShapeLLM: Universal 3D Object Understanding for Embodied Interaction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17766","snapshot_observed_at":"2026-08-10T20:39:12.669702Z","title":"Shapellm: Universal 3d object understanding for embodied interaction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.669702Z"},"links":{"cited_paper":"/paper/2402.17766","citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:794de65bc44575b65e5099743bdb970bba32794454b540f6d3e05bc6d7c25f4f","observation_id":"b9690402-a39d-4b5e-b218-a55365a7d2d2","resolution":{"observed_at":"2026-08-10T20:39:12.669702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.581094Z","title":"Ulip: Learning a unified representation of language, images, and point clouds for 3d understanding,","venue":null,"work_id":"0b25488e-f6ac-4d0b-a960-8ffe7e2620e2","year":2023},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.674278Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:b86a03a260d6bc99e7a7500da17ce21d613f8b905b4cea13c7a2b0e27490ce70","observation_id":"199f1a3b-46a0-4550-9002-399de16f956c","resolution":{"observed_at":"2026-08-10T20:39:13.586955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.564695Z","title":"Openshape: Scaling up 3d shape representation towards open-world understanding,","venue":null,"work_id":"f671d5f1-e0f1-49cd-bf84-2a5d906bd2b1","year":2024},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.678905Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:b33c26d777c182f9486a2093af49d6b747ebd0507afe95de7c3b6795599da6d7","observation_id":"7146b3f7-ccfe-4720-bd8b-5d861a27bb73","resolution":{"observed_at":"2026-08-10T20:39:13.569847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.548418Z","title":"Contrast with reconstruct: Contrastive 3d representation learning guided by generative pretraining,","venue":null,"work_id":"afd59daf-8761-43a6-8172-a0d29eabf722","year":2023},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.684822Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:ec4a9dd2685c34645124c52ce7dae7f7fa9f37cb05155896be4af1ccc125312c","observation_id":"11682bad-c7ed-437e-a279-7bb85f95b4d8","resolution":{"observed_at":"2026-08-10T20:39:13.553376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-10T20:39:12.689677Z","title":"Llama-adapter v2: Parameter-efficient visual instruction model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.689677Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:565402bd3417f1ea58d3fc6489378a5a5016a165b233622718efe2647225e586","observation_id":"84f41382-658e-4b23-9bbc-0f1133c29f1c","resolution":{"observed_at":"2026-08-10T20:39:12.689677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13345","last_updated":"2024-03-19T09:00:32Z","snapshot_observed_at":"2026-08-06T06:56:31.746476Z","submitted_at":"2023-09-23T11:36:15Z","title":"BAMBOO: A Comprehensive Benchmark for Evaluating Long Text Modeling Capacities of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.13345","snapshot_observed_at":"2026-08-10T20:39:12.694961Z","title":"Bamboo: A comprehensive benchmark for evaluating long text modeling capacities of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.694961Z"},"links":{"cited_paper":"/paper/2309.13345","citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:588416b7a3b6ac9256c930a6e7816f9dd9df60b2b148f63f212388f70eb8ae2e","observation_id":"43aef20e-db89-4dff-8531-be3e8189dbf2","resolution":{"observed_at":"2026-08-10T20:39:12.694961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-10T20:39:12.699950Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.699950Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:5e059c9dac3f41c043b36879e69bc1116502c5c54cabfd07b2a10204f49a7f12","observation_id":"2961d74e-47ac-4eb1-aefa-c5cf3c4b02df","resolution":{"observed_at":"2026-08-10T20:39:12.699950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.531670Z","title":"Visual instruction tuning,","venue":null,"work_id":"fdf3accc-1f5e-48cb-a916-4766a6f0f4c7","year":2024},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.705345Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:2fa123c3de8abed44a6b65b1af00537d65ccb74c2f50cd5f9be807338b1ee76f","observation_id":"e072ceeb-fb24-4ee5-8742-ac729be88d55","resolution":{"observed_at":"2026-08-10T20:39:13.537382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-10T20:39:12.711385Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.711385Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:aac231652cac5163dd8bc665c21e6fc280fd9353f2f2be663643129f1766d7bd","observation_id":"51a66ac0-39ab-465c-86b7-5954b17470f3","resolution":{"observed_at":"2026-08-10T20:39:12.711385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:12.717610Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.717610Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:f29f3f97689697bd63afa2ac2cfa8d608af0ce466659842ee0c868e774b8f852","observation_id":"489413b1-2a61-445c-aeb1-fbb29118e12b","resolution":{"observed_at":"2026-08-10T20:39:12.717610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.504058Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"6c628184-d7bf-4887-b4e5-9834411dda1c","year":2021},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.723595Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:3c1bf9736e57f48c889ce4b6e54debdf75bdbda2694149a6693b254d9cd0c267","observation_id":"27ae5591-3cc4-40d7-8fc5-4dfe36296ef3","resolution":{"observed_at":"2026-08-10T20:39:13.509451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:12.729151Z","title":"4d spatio-temporal convnets: Minkowski convolutional neural networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.729151Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:5c75148b695802809a5030751abd0fd51933266891c7dc6bc64c053d8d667d7e","observation_id":"b03ea6e5-2791-4900-a1b2-af686b0e5f11","resolution":{"observed_at":"2026-08-10T20:39:12.729151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.472755Z","title":"Point transformer,","venue":null,"work_id":"3c17683e-2881-405c-a5c5-906560858de0","year":2021},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.734456Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:ae335dba39cd1011f4d7f35eb58f1293e04e5c8ad1b632dde82d0936d1f72faf","observation_id":"eb37209c-9864-44f0-96fd-5607582103c0","resolution":{"observed_at":"2026-08-10T20:39:13.477999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.453246Z","title":"slam: Dense slam meets automatic differentiation,","venue":null,"work_id":"c278b496-d488-40fa-80dd-07ebe6016aec","year":2020},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.739314Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:a549f444762415d1c434ccf40e67f04e4b6dbebba9f6990639d9ae21cdec9c84","observation_id":"9dbd8e82-1bb1-4f20-b1c0-e73f73c3c873","resolution":{"observed_at":"2026-08-10T20:39:13.459257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01852","last_updated":"2024-01-22T03:11:15Z","snapshot_observed_at":"2026-08-07T05:10:33.059352Z","submitted_at":"2023-10-03T07:33:27Z","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01852","snapshot_observed_at":"2026-08-10T20:39:12.744650Z","title":"Languagebind: Extending video-language pre- training to n-modality by language-based semantic alignment,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.744650Z"},"links":{"cited_paper":"/paper/2310.01852","citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:183fb76abb49d936b063f7f689b07143deae8926b5397fe2d1f2883ea442f2dd","observation_id":"5287a31b-8269-4532-9396-18bd72f82627","resolution":{"observed_at":"2026-08-10T20:39:12.744650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.434897Z","title":"Context-aware alignment and mutual masking for 3d-language pre-training,","venue":null,"work_id":"1470868b-cb51-4f38-8b29-dfcda1827d93","year":2023},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.750530Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:029ad36ab30e5fa5707f1557214deeacd34b6c15a07a2a4a04b40c1239112cf6","observation_id":"92a66cc1-1d39-49e0-aa03-98ddec7f179b","resolution":{"observed_at":"2026-08-10T20:39:13.440400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.416994Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understanding reasoning and planning,","venue":null,"work_id":"fa5e5082-3d3d-4a78-be03-8e04c2faf557","year":2024},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.755718Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:f58c7e38ec3b3ae269f125bdb97a13317eeb1981e047cac0ea72458897250eff","observation_id":"a7b91f80-1c30-452a-b690-2b3b0e639472","resolution":{"observed_at":"2026-08-10T20:39:13.422876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.398062Z","title":"Cider: Consensus- based image description evaluation,","venue":null,"work_id":"8ded0dc2-7ddb-4f7f-ad0f-be037c012e83","year":2015},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.760661Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:64173b9dd0c25a0ea568ad130dbd62e3e1b8445c6a6ae55bb37c0b2f01e09b60","observation_id":"01d1941d-f9f0-4048-aa9b-c0a58889375c","resolution":{"observed_at":"2026-08-10T20:39:13.403734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.379028Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":"0e9548f4-35d8-4c1b-a43e-9c76930b6366","year":2002},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.765569Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:e4d8fce84d78996a6fff7aa4d7b336ca9c0353b6614c792326f290fe7f9745d1","observation_id":"2888d537-fda7-40f5-806d-4849acac4193","resolution":{"observed_at":"2026-08-10T20:39:13.385071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.361396Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments,","venue":null,"work_id":"70452b34-ffdd-42a0-9ef6-3e3b1f090478","year":2005},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.770202Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:22dfe9dcc1900d983bb29f6f66c1512b2f0206634d6cc3c9cdeef647be24092c","observation_id":"5c93929f-3281-45a8-b720-fba181e57d35","resolution":{"observed_at":"2026-08-10T20:39:13.366738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:12.774546Z","title":"Rouge: A package for automatic evaluation of summaries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.774546Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:b61ed427d146f865f258bc2c1a496ed58575d824c7ebb02a57cb49f4ca01f7d2","observation_id":"b33b90a1-ac3f-4f2d-9fc1-8d37aa5a8a1e","resolution":{"observed_at":"2026-08-10T20:39:12.774546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:12.779101Z","title":"Mask3d: Mask transformer for 3d semantic instance segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.779101Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:3803a70698adc35dc244534158ad0669407b2aa4d8fdb04c6cf6143e6f2e2af6","observation_id":"98e26045-219e-4bfe-be49-e6b22eecc441","resolution":{"observed_at":"2026-08-10T20:39:12.779101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:12.783741Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.783741Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:3c423894f96fc3b773f7bea0fece02c8fa697afbe0fc54d2f97f392d9fbf159c","observation_id":"812c78b1-b1b7-4895-a80b-d5fd3c69dd3a","resolution":{"observed_at":"2026-08-10T20:39:12.783741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.310198Z","title":"3d-vista: Pre-trained transformer for 3d vision and text alignment,","venue":null,"work_id":"d4e1e336-5b09-4808-8357-f531ade1e010","year":2023},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.788269Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:b38e4614c2758e874bdd6d5e5c9ba5f3c3f44b9b555c1abece1e3e19fa52487a","observation_id":"836d19e6-d68b-4282-8b6c-9606a30d2992","resolution":{"observed_at":"2026-08-10T20:39:13.315861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-07-06T14:08:18.855958Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-08-10T20:39:12.793736Z","title":"Scaling instruction-finetuned language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.793736Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:63898a67881dae8cf6f86aa3e5d665c03dd28a2de500d83c17a2208f9ecaa8e9","observation_id":"9b6f0acb-dab6-4861-9b44-8b2625642794","resolution":{"observed_at":"2026-08-10T20:39:12.793736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-10T20:39:12.798622Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.798622Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:dbe33af59a328a84936859ebd7c456240695de605c726fb81c4d6048fe450f6c","observation_id":"e46bb015-5a37-4b73-94d5-2350e39a3335","resolution":{"observed_at":"2026-08-10T20:39:12.798622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.291458Z","title":"V otenet: A deep learning label fusion method for multi-atlas segmentation,","venue":null,"work_id":"ee5e617a-6952-49d6-993d-e0ddb40ed431","year":2019},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.804140Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:6660dc8f7c2cf5be0c5389d56457daa223da2f5c65609bc55801f8d07c61a290","observation_id":"d894135c-e36f-4193-8e0e-be7883d1cb40","resolution":{"observed_at":"2026-08-10T20:39:13.297387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:39:13.270158Z","title":"Deep modular co-attention networks for visual question answering,","venue":null,"work_id":"b640c940-3d50-4d65-92a9-392df0b499fa","year":2019},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.809687Z"},"links":{"citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:53bf83c1eb16c500ca769badcca768038b239870ca3843e133949b39be0c0ce4","observation_id":"87d23797-1061-4368-a0bb-6ba93a11f832","resolution":{"observed_at":"2026-08-10T20:39:13.278368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T23:07:26.347586Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 3 inbound Pith citation observations for arXiv:2501.07819."}