{"as_of":"2026-08-20T19:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4fe3e9f8bbf38314ed36e37f3362af3f60915a22c8fb792b9c3b975897ed044e","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:25:48.557534Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T18:56:43.374310Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T10:46:01.488781Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"cited_work":{"arxiv_id":"2506.05318","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05318","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8f2ae72c-c350-489f-a4cb-ce1f5ec1e181","year":2025},"citing_paper":{"arxiv_id":"2604.12908","last_updated":"2026-08-12T08:45:14Z","snapshot_observed_at":"2026-08-15T23:09:23.102035Z","submitted_at":"2026-04-14T15:57:16Z","title":"Robotic Manipulation is Vision-to-Geometry Mapping: Vision-Geometry Backbones over Language and Video Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T15:20:47.418874Z"},"links":{"cited_paper":"/paper/2506.05318","citing_paper":"/paper/2604.12908"},"observation_digest":"sha256:9322b965d2779905a79a966abb7aeaa66bf29a3c552fa8e895c715d0324c9159","observation_id":"eefd24f7-3dc7-4112-82dc-548b3dead336","resolution":{"observed_at":"2026-05-11T10:46:01.498028Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05318","snapshot_observed_at":"2026-07-12T18:56:43.374310Z","title":"Haifeng Huang, Yilun Chen, Zehan Wang, Rongjie Huang, Runsen Xu, Tai Wang, Luping Liu, Xize Cheng, Yang Zhao, Jiangmiao Pang, and 1 others","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07529","last_updated":"2026-04-21T02:43:28Z","snapshot_observed_at":"2026-08-16T14:07:12.910931Z","submitted_at":"2026-04-21T02:43:28Z","title":"CAPruner: Conceptual-Adjacent Scene Graph Pruner for Enhancing 3D Spatial Reasoning of Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T18:56:43.374310Z"},"links":{"cited_paper":"/paper/2506.05318","citing_paper":"/paper/2606.07529"},"observation_digest":"sha256:6b79c968e4e99bc824f39c1d1752afe47d7938d456f20bc28cc5f5b37807f266","observation_id":"4d9868d3-4dde-4524-a927-dbd72da50379","resolution":{"observed_at":"2026-07-12T18:56:43.374310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05318/citation-record","integrity":"/paper/2506.05318/integrity","json":"/paper/2506.05318/citation-record.json","paper":"/paper/2506.05318"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:57.872660Z","title":"Referit3d: Neural listeners for fine-grained 3d object identification in real-world scenes","venue":null,"work_id":"45361030-bfdb-4da0-8546-440d90f8b5c2","year":2020},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:43.825034Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:fed1c77a84e57f28c5d5500c904a423cb6c1de9d55d92511bd480efd5f3b01a9","observation_id":"6bdcce7d-0b59-4581-bd7d-e0bd413fbd3e","resolution":{"observed_at":"2026-08-07T10:25:58.041928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:57.568793Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":"eacef442-b178-47b9-bba0-826dcdca5acf","year":2022},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:43.893027Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:4699292febc4e626da856a2798365d6ae87c134f0d71710bad2b5190a04e0915","observation_id":"100fc6bc-4584-4849-af90-bf20b0f5694f","resolution":{"observed_at":"2026-08-07T10:25:57.703884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:57.313025Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":"41504354-a4e9-4e83-b6f0-9d106e605845","year":2020},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:43.944631Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:06ed694962efd2fd89c738735446b0021903edd1251a1fe37019ec3ac5fbc72f","observation_id":"8f7d2a4b-5066-42dd-b54e-045aae48f131","resolution":{"observed_at":"2026-08-07T10:25:57.444816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:57.071764Z","title":"Language conditioned spatial relation reasoning for 3d object grounding.Advances in neural information processing systems, 35:20522–20535, 2022","venue":null,"work_id":"585724c4-2910-4b46-96df-34804a7b42b6","year":2022},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:43.984815Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:3e032ac5b86f84d0c5ddc03acaf0c58538345cb51f2c0e1c030a8328b33c6ec3","observation_id":"bb3deee4-3811-4fa5-9fba-4664d28f59e2","resolution":{"observed_at":"2026-08-07T10:25:57.138194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:56.923543Z","title":"End-to-end 3d dense captioning with vote2cap-detr","venue":null,"work_id":"fbd8ac16-9815-48dd-93e9-bcb7c44d274a","year":2023},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:44.057122Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:da4ce570e549983e777c1766fcd1011f957e49da19e19d856af5c51638e0be36","observation_id":"8deda4f2-318b-4b76-a7c3-b92d2c9a4db9","resolution":{"observed_at":"2026-08-07T10:25:56.985943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:56.795256Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understanding reasoning and planning","venue":null,"work_id":"ddc2bc86-e3bd-4f38-8e97-9194858743a1","year":2024},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:44.112929Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:2cc14ae7ee673a9be845db4a6e048600cf11e932c799bc8c4829a7c9003b3b9f","observation_id":"041477f3-2ae1-4e60-a619-b58dd87b9c44","resolution":{"observed_at":"2026-08-07T10:25:56.859466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:56.609889Z","title":"V ote2cap-detr++: Decoupling localization and describing for end-to-end 3d dense captioning.IEEE Transactions on Pattern Analysis and Machine Intelligence, 46(11):7331–7347, 2024","venue":null,"work_id":"5e9822e6-4cfc-4372-adae-ccbc77f8fbd1","year":2024},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:44.146472Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:d726a94a5ae9cbe70b49ef0f518cc4f5ef896ea2360d6783a401f5f100eb4732","observation_id":"5cb04d7e-a3d3-40a6-8bc7-69660d140e83","resolution":{"observed_at":"2026-08-07T10:25:56.675993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10370","last_updated":"2024-11-18T08:29:08Z","snapshot_observed_at":"2026-08-18T13:34:10.935081Z","submitted_at":"2024-05-16T18:03:41Z","title":"Grounded 3D-LLM with Referent Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10370","snapshot_observed_at":"2026-08-07T10:25:44.197695Z","title":"Grounded 3d-llm with referent tokens.arXiv preprint arXiv:2405.10370, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:44.197695Z"},"links":{"cited_paper":"/paper/2405.10370","citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:0269b0659420b17b8da67efdbd684616ef2ddc5408a8581bca14cfeaa6b2e068","observation_id":"cf2dd138-cdb3-4e45-8ce3-5beb2f586286","resolution":{"observed_at":"2026-08-07T10:25:44.197695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:56.402125Z","title":"Scan2cap: Context-aware dense captioning in rgb-d scans","venue":null,"work_id":"47929020-65ae-4d0a-877e-311c711c13dd","year":2021},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:44.260044Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:95e32f8d337b393fa1b5842d813c40be1bfd75a43f6e1b56f747a232804f9225","observation_id":"30fdcd5a-1517-4913-a1f8-052590027ef2","resolution":{"observed_at":"2026-08-07T10:25:56.506988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:56.249076Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"2bf30271-5cd9-4735-b4b1-ba4b3bf3d978","year":2024},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:44.303854Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:a7059c08d1b8aa92332454b49aa16ff7cba5e299a3da6dcca180622be21b4eef","observation_id":"b09f00b7-b29b-47c3-9230-584725cf07f2","resolution":{"observed_at":"2026-08-07T10:25:56.323773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:56.049676Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":"00378fe6-8200-46f4-b25a-271e90d94fe7","year":2017},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:44.375288Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:d696d11d66b07e9f73b37dc6c8fd2369c0b29c6fba14533ba249b65b82b4eb99","observation_id":"82ef0af7-25ed-44b1-897b-505d4bbbee8a","resolution":{"observed_at":"2026-08-07T10:25:56.155249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-16T05:38:56.513422Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-08-07T10:25:44.412461Z","title":"Internlm-xcomposer2: Mastering free-form text-image composition and comprehension in vision-language large model.arXiv preprint arXiv:2401.16420, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:44.412461Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:a584c25836bd5395a263b963f4eb76ac8b3116b407f05ee039cca13a5efe1d96","observation_id":"f4da52c8-f29b-4cf7-bc32-9ff3de54291e","resolution":{"observed_at":"2026-08-07T10:25:44.412461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-07T10:25:44.471372Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following.arXiv preprint arXiv:2309.00615, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:44.471372Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:65ae86f348f9dcecd390cccaa61ab62240905622e9b39c5f51739965ca23f9f8","observation_id":"6dcc3e57-1339-43a5-89b4-aa16ea337daa","resolution":{"observed_at":"2026-08-07T10:25:44.471372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:55.868630Z","title":"3d-llm: Injecting the 3d world into large language models.Advances in Neural Information Processing Systems, 36:20482–20494, 2023","venue":null,"work_id":"8a4fc333-8641-4276-a413-2fa14eba94c6","year":2023},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:44.536919Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:e62c00e92b9c786ac33231d540241559bc9da488d350cc95d56d652b6b58e46a","observation_id":"bccfe3f7-61f1-463d-b7dc-a8cb42dad842","resolution":{"observed_at":"2026-08-07T10:25:55.954650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:55.672322Z","title":"Chat-3d v2: Bridging 3d scene and large language models with object identifiers.CoRR, 2023","venue":null,"work_id":"c5fce441-cec7-4b8e-9e9b-e3643af42cb6","year":2023},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:44.588379Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:5aec1e2c6bd3d8374349ecdcc3952c43dd184291f9a532dd373c00d7159e92c7","observation_id":"11268861-15b5-4cb8-8c3d-6479a7bbe137","resolution":{"observed_at":"2026-08-07T10:25:55.762030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-05T10:01:43.401012Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-08-07T10:25:44.641349Z","title":"An embodied generalist agent in 3d world.arXiv preprint arXiv:2311.12871, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:44.641349Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:f684afecfd5b6a5ab0f3d90a4112fc46c7dd18ee54afe7ae506e4018145f1f61","observation_id":"1ffbeb72-5633-4309-a665-f5ac60618414","resolution":{"observed_at":"2026-08-07T10:25:44.641349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:55.448752Z","title":"Clip2point: Transfer clip to point cloud classification with image-depth pre-training","venue":null,"work_id":"26b0ec00-7d26-4980-830f-7411f182c8f0","year":2023},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:44.695833Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:32dd02615c303252ca75fa751ea1eb90209049d424c4995d6307c2242c0944f5","observation_id":"010ccd29-85dd-41c1-b224-e0d71ea926d9","resolution":{"observed_at":"2026-08-07T10:25:55.571576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04098","last_updated":"2023-12-10T16:47:58Z","snapshot_observed_at":"2026-08-16T16:10:08.227386Z","submitted_at":"2022-12-08T06:27:11Z","title":"EPCL: Frozen CLIP Transformer is An Efficient Point Cloud Encoder","version":3},"cited_work":{"arxiv_id":"2212.04098","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.04098","snapshot_observed_at":"2026-08-07T10:25:49.629363Z","title":"EPCL: Frozen CLIP Transformer is An Efficient Point Cloud Encoder","venue":"cs.CV","work_id":"6cd15ea3-60e4-49c2-8761-80535c14d298","year":2022},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:44.757938Z"},"links":{"cited_paper":"/paper/2212.04098","citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:f1fac28ff3d9c1b79c7b52d6b86dd4e3ed259ffa88ac0372deb7e0165f980fd7","observation_id":"ce662654-1fb8-4b90-954d-4814eb2b5d09","resolution":{"observed_at":"2026-08-07T10:25:49.741416Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:55.259750Z","title":"Pointgroup: Dual-set point grouping for 3d instance segmentation","venue":null,"work_id":"2461915f-6e9c-4e04-aa18-290105f3bde3","year":2020},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:44.792848Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:e52f4abed6b242b65d3a8375b9195779811914768c390340166e153d22be2696","observation_id":"47142fba-bd28-448d-9d75-888df2427826","resolution":{"observed_at":"2026-08-07T10:25:55.345276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17860","last_updated":"2025-02-27T08:30:00Z","snapshot_observed_at":"2026-08-16T12:55:30.283839Z","submitted_at":"2025-02-25T05:10:22Z","title":"UniGS: Unified Language-Image-3D Pretraining with Gaussian Splatting","version":2},"cited_work":{"arxiv_id":"2502.17860","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.17860","snapshot_observed_at":"2026-08-07T10:25:49.172654Z","title":"UniGS: Unified Language-Image-3D Pretraining with Gaussian Splatting","venue":"cs.CV","work_id":"b2bbad70-3126-4130-ac64-ac8756c2cba6","year":2025},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:44.844043Z"},"links":{"cited_paper":"/paper/2502.17860","citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:d7eb2d3f1624f329a5cb3e888c0493d2cda9cf3336c6be5c3bc95c3a55cb3cd4","observation_id":"da47fbf2-09d1-41ea-959e-3625e160701c","resolution":{"observed_at":"2026-08-07T10:25:49.294714Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:55.062134Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"1ba46b9c-cc55-460b-8992-6a87f785697c","year":2023},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:44.881734Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:fa6870c2dff0d511c2cd398f375a9aec409541a5e06a20a0a8ee4150cfc497a5","observation_id":"f4f92c8f-8fc5-44cf-9551-5a63b714e995","resolution":{"observed_at":"2026-08-07T10:25:55.151557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:54.836560Z","title":"3dmit: 3d multi-modal instruction tuning for scene understanding","venue":null,"work_id":"4a0f07e5-f69c-4982-895e-6f46b44a6c3b","year":2024},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:44.918609Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:a096ed417a9e5fcebae021bbcb9e40625b144023eaf1b0a9e26eb00497a030e1","observation_id":"06a4d3a4-83f8-4397-b289-01023e0bfbc5","resolution":{"observed_at":"2026-08-07T10:25:54.928381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:54.489415Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":"5fec4dcc-2112-4a8c-865c-437709e95ae9","year":2004},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:44.983268Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:8a43a6946bea4b74ff6af818f66708457371c24f45e51e257ae289428d2615e3","observation_id":"32568edd-6148-4a88-a6f9-17591953b7ef","resolution":{"observed_at":"2026-08-07T10:25:54.710935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T10:25:45.062126Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:45.062126Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:5f5c6cb2fdfa03c1967e11421b5534a531bb1a34b302acc6bb5126f9763f70c2","observation_id":"62e534d6-3bdc-43e4-8224-e3c23053b65f","resolution":{"observed_at":"2026-08-07T10:25:45.062126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:54.127563Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":"12349e98-17f8-4e4a-8c85-26a2163eeb7e","year":2023},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:45.129747Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:3b46baa614cdf8495eacc7cbd5a22d7a49c0a84c2a2ac0b3b67f3c9fc7401b55","observation_id":"399c8d97-cceb-4736-811f-4353f632abfe","resolution":{"observed_at":"2026-08-07T10:25:54.253150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:53.875429Z","title":"Openshape: Scaling up 3d shape representation towards open-world understanding.Advances in neural information processing systems, 36:44860–44879, 2023","venue":null,"work_id":"7cbb1168-13ae-4cbf-94ab-1cacf1c7add3","year":2023},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:45.214919Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:d0b117bb227277db6ba0b85ee5d3bb047aec63c3b991c0ed513352c844926f19","observation_id":"0afcfae9-9c24-4e28-88c5-92b07520c2a7","resolution":{"observed_at":"2026-08-07T10:25:53.994244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T10:25:45.301176Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:45.301176Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:c41778ad3d210e40fef3493919e273f4c50d039263cb0980efc9174b9cca1fa6","observation_id":"b5709a7f-17aa-45f9-b753-dd1ce3348b3c","resolution":{"observed_at":"2026-08-07T10:25:45.301176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-07T10:25:45.371810Z","title":"Sqa3d: Situated question answering in 3d scenes.arXiv preprint arXiv:2210.07474, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:45.371810Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:f64855b461655386e4985ef0e76a4fa2b8aa5e334ae770675ff0cb91d3dc1c5d","observation_id":"fd4dec3b-1a3b-4b5f-b142-d4d15b470c63","resolution":{"observed_at":"2026-08-07T10:25:45.371810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:53.670776Z","title":"Image caption generation using vision transformer and gpt architecture","venue":null,"work_id":"38f308fd-da55-4d20-8076-f98dc54849a9","year":null},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:45.453544Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:0933e6ca07c30955ecbe6d27270be1dd774aaa80e2d291261d72705de8a7249c","observation_id":"f8bb490b-426c-4d49-91f5-07d3e3abf549","resolution":{"observed_at":"2026-08-07T10:25:53.742079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:53.418527Z","title":"An end-to-end transformer model for 3d object detection","venue":null,"work_id":"2e41513e-4906-4611-a055-79d8b07d0eb3","year":2021},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:45.519598Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:3da4128d402e682e561819eda5218851b8a0ad5adfebfaa3102f5a9ed27d5c67","observation_id":"769730cb-d3d3-4aa4-a850-281de509c935","resolution":{"observed_at":"2026-08-07T10:25:53.533453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:53.243641Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"f9eb7c2a-7a7f-420c-beb3-2cc0df1d68af","year":2002},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:45.639278Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:03dc7249ae783502436ae56c51a98735652a73556fbfe907fbf355ff736a5471","observation_id":"2bfb3ae7-65b9-4250-8d73-eddabd07daad","resolution":{"observed_at":"2026-08-07T10:25:53.333859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:45.755039Z","title":"Pointnet++: Deep hierarchical feature learning on point sets in a metric space.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:45.755039Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:1f48b1be37009c38dec3874c262eedc043b2f8253eefde74b3929eb733830800","observation_id":"b1e9ef53-b409-4ca9-8f1c-77dbf5b48b3c","resolution":{"observed_at":"2026-08-07T10:25:45.755039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:52.996031Z","title":"Deep hough voting for 3d object detection in point clouds","venue":null,"work_id":"926825f1-5f7e-432c-912f-90057b5d6d1e","year":2019},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:45.852622Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:f2ef22bef9b77ff7b674c5026fe4eac56ef5cda699ad4a8a9a788bf840109c3e","observation_id":"3fe6de52-0245-4260-8ada-a0899b626538","resolution":{"observed_at":"2026-08-07T10:25:53.103031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:52.754606Z","title":"Minigpt-3d: Efficiently aligning 3d point clouds with large language models using 2d priors","venue":null,"work_id":"8c536b8a-609a-46ff-816b-93a6b6fb689e","year":2024},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:46.010018Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:a5f9ea461576a86d2fa9115b6e1624e62e78bf8c5ad3378797cfec0dbcef2857","observation_id":"23d4407d-e036-4616-8166-7cea9b9c1fd6","resolution":{"observed_at":"2026-08-07T10:25:52.859702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:46.116105Z","title":"Exploring the potential of encoder-free architectures in 3d lmms.arXiv preprint arXiv:2502.09620, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:46.116105Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:35c07216b1aa870ecc4a9bcb07e4739e2968242db54b10dc6b0a7b880c2cf180","observation_id":"58c4ca19-8cce-43af-8c86-ce2b07162d9c","resolution":{"observed_at":"2026-08-07T10:25:46.116105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:52.512492Z","title":"More text, less point: Towards 3d data-efficient point-language understanding","venue":null,"work_id":"a0a3cf2c-76d7-43a6-bf71-cf90d26d9733","year":2025},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:46.275521Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:0cbc589e1f925182ad4098e0db52ab2bf5f354f283bbab889c9cb82cd3c4a90c","observation_id":"fe3eadfa-8ce1-46d7-8376-4faa6ecd7b70","resolution":{"observed_at":"2026-08-07T10:25:52.619439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-08-20T18:27:04.837880Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T10:25:46.374821Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:46.374821Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:263d3b8cdf9aa0e9585e86c1d8c775e226422ce27ab377b0effec991e7ca8960","observation_id":"28f0aee3-b652-4e60-bcc8-976d1a5e2264","resolution":{"observed_at":"2026-08-07T10:25:46.374821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:52.250876Z","title":"Consensus-based image description evaluation","venue":null,"work_id":"d9fb07e6-7db7-4041-8e53-e587f9699ce2","year":null},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:46.482854Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:eaf9d7cb443b376353d98ed5a53f77f9835f9529c8a412a0287b5d062722d9be","observation_id":"8198f18e-47c9-4afa-9541-947ba2f1388d","resolution":{"observed_at":"2026-08-07T10:25:52.400284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:52.096122Z","title":"Rio: 3d object instance re-localization in changing indoor environments","venue":null,"work_id":"57770cb1-84b9-47c6-aa8d-b7bdbf59b3d7","year":2019},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:46.591830Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:782a7d7ed802cc69bf976074cbfcc1b73d6a29304f21a5a20d43e1cb2e909226","observation_id":"5dc01e8f-1205-4a86-b19b-341ee28b23ab","resolution":{"observed_at":"2026-08-07T10:25:52.165563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T10:25:46.735483Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:46.735483Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:b45f3f223488de20beba814b1523791c1b84555b7d81624857e44c69b2c1b244","observation_id":"1e8912ea-486e-4f5b-a969-fb59ab188393","resolution":{"observed_at":"2026-08-07T10:25:46.735483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08769","last_updated":"2023-08-17T03:52:15Z","snapshot_observed_at":"2026-08-20T07:15:08.903665Z","submitted_at":"2023-08-17T03:52:15Z","title":"Chat-3D: Data-efficiently Tuning Large Language Model for Universal Dialogue of 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08769","snapshot_observed_at":"2026-08-07T10:25:46.891351Z","title":"Chat-3d: Data-efficiently tuning large language model for universal dialogue of 3d scenes.arXiv preprint arXiv:2308.08769, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:46.891351Z"},"links":{"cited_paper":"/paper/2308.08769","citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:f396657b8441e480d1191af992c6f5d719930a23f276902230da76a300ff2517","observation_id":"4104cf64-9a79-479a-8a95-aa966c494b5f","resolution":{"observed_at":"2026-08-07T10:25:46.891351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:51.892054Z","title":"Visionllm v2: An end-to-end generalist multimodal large language model for hundreds of vision-language tasks.Advances in Neural Information Processing Systems, 37:69925–69975,","venue":null,"work_id":"04f1b4b6-6a3d-4a1f-b988-6eece7a1ee81","year":null},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:46.964425Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:03061f4ba5ac6df93e079516a8ca51c4925f9e86d1aefe2ae3dd671c4ff305d6","observation_id":"c99e5d3e-9146-45d0-978a-a07c0c56dba5","resolution":{"observed_at":"2026-08-07T10:25:51.991118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:51.734668Z","title":"Ulip: Learning a unified representation of language, images, and point clouds for 3d understanding","venue":null,"work_id":"b36796f3-75fd-49c3-8eb5-237341808069","year":2023},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:46.987087Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:e643be634fdc629c3213961c247dd520b7fdd5eaef84450c63f962df22114fd0","observation_id":"5102ccf4-b033-4b76-bb48-02f6ba6a1321","resolution":{"observed_at":"2026-08-07T10:25:51.792482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:51.546953Z","title":"Ulip-2: Towards scalable multimodal pre-training for 3d understanding","venue":null,"work_id":"33386771-a15d-4723-9e95-58c899acbaab","year":2024},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:47.111172Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:6271e04d9012108fa1aaac90097ed30fa90a55b8baa30468b2d4545d533fd273","observation_id":"3acf0840-5ce8-4a52-9c34-604e9fe48975","resolution":{"observed_at":"2026-08-07T10:25:51.632279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:51.264086Z","title":"Qwen2 technical report, 2024","venue":null,"work_id":"fe215117-5765-4b95-bf20-9e4c1fc81f0f","year":2024},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:47.242464Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:8c74df84a2ed1c2fdba5c061547ba5aa6f219bc2ac85f6b327e39031aa221a96","observation_id":"0ebbd06f-6495-4e7b-88d9-a63067152ccd","resolution":{"observed_at":"2026-08-07T10:25:51.373759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:50.963436Z","title":"Point-bert: Pre-training 3d point cloud transformers with masked point modeling","venue":null,"work_id":"4c86b95d-5d28-47d9-b0ef-486377210d05","year":2022},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:47.373128Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:9d3bd1618aa0f23a20cca797b173a86cec5ca711fd432fe57fea4c61eaf4449b","observation_id":"b22b2eed-7e5a-4d9e-a226-523fdd129e06","resolution":{"observed_at":"2026-08-07T10:25:51.115965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:50.678483Z","title":"Clip2: Contrastive language-image-point pretraining from real-world point cloud data","venue":null,"work_id":"581cb532-cd85-4606-9289-eefdca05bf40","year":2023},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:47.479784Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:fc50af81016eca4564557d55170fd8d82b3cbbabeacdfc03c4deb5f01e1c35ac","observation_id":"958efc78-4c13-491e-8879-b37cd0ca0d39","resolution":{"observed_at":"2026-08-07T10:25:50.804303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:50.507471Z","title":"Pointclip: Point cloud understanding by clip","venue":null,"work_id":"056feeb8-2fd1-4b63-a677-708265477b61","year":2022},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:47.589247Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:0555ffebbdc516b68df88f0ee4f75ed83ab2f6e018007c337adbd9a1dcf4b9ae","observation_id":"b5d08211-3d8a-4617-810f-467a6c6bbefc","resolution":{"observed_at":"2026-08-07T10:25:50.573860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:50.286041Z","title":"Learning 3d representations from 2d pre-trained models via image-to-point masked autoencoders","venue":null,"work_id":"1020ad01-5ec7-4764-838f-1317700a52d2","year":2023},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:47.759632Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:6cba1ad00ed71ff335696f2c976527f1163dd0d537bb8eecf1d62d8a53653851","observation_id":"bf31fa98-f0bf-47ed-ba37-04134f3fff41","resolution":{"observed_at":"2026-08-07T10:25:50.406957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:50.160833Z","title":"Multi3drefer: Grounding text description to multiple 3d objects","venue":null,"work_id":"d4e6a381-d6a0-436e-8773-3a7462e7a2bc","year":2023},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:47.934374Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:0df364d51132f595b13f80460f891feadb37f55a46effbc0de6b55853c117232","observation_id":"670d8369-f6cd-4e0a-8856-002805f573d3","resolution":{"observed_at":"2026-08-07T10:25:50.205731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-19T10:09:56.914941Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01292","snapshot_observed_at":"2026-08-07T10:25:48.086502Z","title":"Lscenellm: Enhancing large 3d scene understanding using adaptive visual preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:48.086502Z"},"links":{"cited_paper":"/paper/2412.01292","citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:c1d00d00abf7d5abb9cfc979469b5db482397b30c6521e8dc8a3eb9607964a12","observation_id":"537570de-39ae-44c7-b1c1-77720a093e87","resolution":{"observed_at":"2026-08-07T10:25:48.086502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06773","last_updated":"2023-10-10T16:49:21Z","snapshot_observed_at":"2026-08-16T14:53:22.965811Z","submitted_at":"2023-10-10T16:49:21Z","title":"Uni3D: Exploring Unified 3D Representation at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06773","snapshot_observed_at":"2026-08-07T10:25:48.210130Z","title":"Uni3d: Exploring unified 3d representation at scale.arXiv preprint arXiv:2310.06773, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:48.210130Z"},"links":{"cited_paper":"/paper/2310.06773","citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:7824e8c32860077026b5b42bdc68662649d6f6538ed2aa1e2ff5e7f410688999","observation_id":"eb23a157-b6c3-4836-91c4-babda4b2c36f","resolution":{"observed_at":"2026-08-07T10:25:48.210130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18125","last_updated":"2025-04-27T06:50:23Z","snapshot_observed_at":"2026-08-16T13:15:01.097068Z","submitted_at":"2024-09-26T17:59:11Z","title":"LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18125","snapshot_observed_at":"2026-08-07T10:25:48.356054Z","title":"Llava-3d: A simple yet effective pathway to empowering lmms with 3d-awareness.arXiv preprint arXiv:2409.18125, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:48.356054Z"},"links":{"cited_paper":"/paper/2409.18125","citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:2b579b7b12f4124f1c0fa5b373a2a32b2e955b72ec2000a04b0e23198e2f60ad","observation_id":"264df855-651c-4abf-a942-66b432d95dc4","resolution":{"observed_at":"2026-08-07T10:25:48.356054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T10:25:48.464649Z","title":"Minigpt-4: Enhancing vision- language understanding with advanced large language models.arXiv preprint arXiv:2304.10592, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:48.464649Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:1c38fd8def0096adc346b86089d19148b7d4dc6ba88e90d0c66e515e6f9b988c","observation_id":"56e5b207-47dd-4e9f-958f-b05bc7d1e707","resolution":{"observed_at":"2026-08-07T10:25:48.464649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:25:49.993061Z","title":"it is to the","venue":null,"work_id":"d5b0309a-5d88-48fd-a292-9ec7c4825505","year":2023},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:48.557534Z"},"links":{"citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:dc0f7e6eee1874c64bc45cc4dd777ccdff7d3434495946671c6afbb7fbb4a0be","observation_id":"d0715743-8459-4717-899e-aec8b4b8eaa5","resolution":{"observed_at":"2026-08-07T10:25:50.075180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T11:43:18.155260Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":2,"verified_fuzzy":37},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 2 inbound Pith citation observations for arXiv:2506.05318."}