{"as_of":"2026-08-19T10:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:194fbc8f16e29f9186832eb3f53de5ed6670b74450285293da44a2a1653d6f42","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T19:53:22.619176Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:49:39.643676Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T14:49:39.758012Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"cited_work":{"arxiv_id":"2412.06292","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.06292","snapshot_observed_at":"2026-08-05T14:49:39.758012Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","venue":"cs.CV","work_id":"f9e61577-3180-4e5e-8253-a49200d9b8ad","year":2024},"citing_paper":{"arxiv_id":"2508.20830","last_updated":"2025-08-28T14:25:32Z","snapshot_observed_at":"2026-08-14T23:55:19.962155Z","submitted_at":"2025-08-28T14:25:32Z","title":"Estimating 2D Keypoints of Surgical Tools Using Vision-Language Models with Low-Rank Adaptation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T14:49:39.643676Z"},"links":{"cited_paper":"/paper/2412.06292","citing_paper":"/paper/2508.20830"},"observation_digest":"sha256:925d4d9ac08275ae2117af7ec41c103efb1ee3f0e90277f4f3c162f194b73aa4","observation_id":"7f9daa15-1422-4e9f-ba24-35f50659d139","resolution":{"observed_at":"2026-08-05T14:49:39.762699Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.06292/citation-record","integrity":"/paper/2412.06292/integrity","json":"/paper/2412.06292/citation-record.json","paper":"/paper/2412.06292"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:22.379194Z","title":"Zero-shot 3d shape correspon- dence","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.379194Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:27ecebee859172efdc04f8d97ef12b5751683cac593bc85901b33b6a245349c6","observation_id":"c2de93c0-e140-413a-9279-2a2bee636f38","resolution":{"observed_at":"2026-08-11T19:53:22.379194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:23.514382Z","title":"Satr: Zero-shot semantic segmentation of 3d shapes","venue":null,"work_id":"6036a29a-7675-4c51-a920-08536d14f66e","year":2023},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.385098Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:6db5309396e6e31c6aabc5e79740d253125837c9c92123023554518331acddaa","observation_id":"4dff6c20-b5f1-463f-8ac6-c950b1c21202","resolution":{"observed_at":"2026-08-11T19:53:23.521990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:22.389449Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.389449Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:33c43a873f118a768a5034acf4a1eb17250497964de831fc3bde1c15f6eaef18","observation_id":"582e0e54-aceb-4f25-9f97-0410510bf224","resolution":{"observed_at":"2026-08-11T19:53:22.389449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:23.483221Z","title":"Claude 3.5 sonnet model card addendum","venue":null,"work_id":"eefa693d-e97d-49d7-a314-e14a3e4816eb","year":2024},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.394568Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:799669422f3ab7acdfc63afdefc92524058f6c5946087eeb734b1ade4a318405","observation_id":"00ab1aeb-bb33-4a83-98a1-05180b557ac2","resolution":{"observed_at":"2026-08-11T19:53:23.489572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:23.463268Z","title":"Ncp: Neural cor- respondence prior for effective unsupervised shape match- ing","venue":null,"work_id":"f4bc63a1-7280-4ab3-a21b-6c224a9b9635","year":2022},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.400519Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:5ad4a72a686af5988b9aca59eb0891da8c53e4ea19ad4860ae821af1b40f3c27","observation_id":"a087627a-9cb8-40bb-862a-825fbf1e4aed","resolution":{"observed_at":"2026-08-11T19:53:23.468354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-11T19:53:22.405338Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.405338Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:63bcc1907887390d14009dbef04b0034122f293265ff336a776237b1497af258","observation_id":"f7dd7139-ff39-43db-ac0d-2391eb2563cc","resolution":{"observed_at":"2026-08-11T19:53:22.405338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00238","last_updated":"2025-04-16T21:59:00Z","snapshot_observed_at":"2026-08-19T03:07:00.889276Z","submitted_at":"2024-10-31T22:24:47Z","title":"Understanding the Limits of Vision Language Models Through the Lens of the Binding Problem","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00238","snapshot_observed_at":"2026-08-11T19:53:22.410059Z","title":"Understanding the limits of vision language mod- els through the lens of the binding problem","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.410059Z"},"links":{"cited_paper":"/paper/2411.00238","citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:bd91a528164125c9d7d9efea5b45d5451912edc6e1e400374492c52a93ce8ccb","observation_id":"e4a6b8df-d928-4025-8a99-7c7a08556dc7","resolution":{"observed_at":"2026-08-11T19:53:22.410059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:23.443189Z","title":"Unsuper- vised learning of intrinsic structural representation points","venue":null,"work_id":"d901eeab-c91a-4461-8aab-fcee919bd09f","year":2020},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.414870Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:9eabb8f7fd006dcabd5b00c8a2940e5df2ac3eb2d2c48eeb35b957d127423df7","observation_id":"df6fb406-9c59-4005-8af0-f8f2fb23d155","resolution":{"observed_at":"2026-08-11T19:53:23.448792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:23.422478Z","title":"Schelling points on 3d surface meshes","venue":null,"work_id":"af9aa9d3-158e-48b3-a5d3-9f868cd53d47","year":2012},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.419429Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:7e6dffdce5810c0f2bf09b6848448cb5d6d5ae3a7cb6120b1a34051bb0418646","observation_id":"53c55fa8-823e-4c88-96d4-b78f4bd50586","resolution":{"observed_at":"2026-08-11T19:53:23.429886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:23.403410Z","title":"3dmv: Joint 3d-multi- view prediction for 3d semantic scene segmentation","venue":null,"work_id":"af9ec3c4-19d4-491e-8471-08cc7ba0637d","year":2018},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.423666Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:9bf5729551f772dbfa53923828457033a3fcb405611abb427e7d2f89e8f9509d","observation_id":"470d239a-0fdf-4916-a21b-88394179106c","resolution":{"observed_at":"2026-08-11T19:53:23.410607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-11T19:53:22.427754Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.427754Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:db6c58599dba2bb61cbd5ad881cd7951ee5c7d50c62ca1e86b5c65283f2d7fcb","observation_id":"f77e4a32-2e12-4a46-aae2-878e19db2235","resolution":{"observed_at":"2026-08-11T19:53:22.427754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:23.377934Z","title":"Unsupervised learning of category-specific symmetric 3d keypoints from point sets","venue":null,"work_id":"5df01561-c019-49bd-9df1-6fa8e9ad8918","year":2020},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.432903Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:d1a1ade19d66cc2d723f16ae677add967fc9ea351f168403ff762c6c386555c2","observation_id":"b39572e5-31b4-49c3-ab91-3ab8e891485f","resolution":{"observed_at":"2026-08-11T19:53:23.382461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:23.359670Z","title":"Mvtn: Multi-view transformation network for 3d shape recognition","venue":null,"work_id":"0d9c54a5-0d7d-4237-9b19-5b9329e41a9f","year":2021},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.437148Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:0bce7a0a9939b8c37b9e84bccd96d6b619f87c4f52963f0a2045d81643e2cf3d","observation_id":"a1009d42-3e04-49a0-88bd-73d605595d87","resolution":{"observed_at":"2026-08-11T19:53:23.365304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:23.341510Z","title":"V oint cloud: Multi-view point cloud representation for 3d understanding","venue":null,"work_id":"1760e721-7521-474e-8749-2ccc0ec0a328","year":2023},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.441286Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:f6390df48f4116b65e2a2498e6d8e4936b379f135817e3571c7305de1f97be35","observation_id":"1871914a-392b-44be-989b-a3599c4d210b","resolution":{"observed_at":"2026-08-11T19:53:23.349447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:23.326302Z","title":"Mvtn: Learning multi-view transforma- tions for 3d understanding","venue":null,"work_id":"dbeae819-65b0-41a0-9ab5-b85c85ec9c3e","year":2024},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.445167Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:8111724f6acac85cadb22f3b1f9d67a8f2e39b183adef51276a72f9e66cdd810","observation_id":"84a880fa-5ed3-415a-bb82-e681933076af","resolution":{"observed_at":"2026-08-11T19:53:23.331028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:23.311672Z","title":"Unsupervised keypoints from pretrained diffusion models","venue":null,"work_id":"d162ffd8-0ccd-47b5-bb05-0a98b93a1464","year":2024},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.449699Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:62e6bd923dcd9f4f80824ddfea13a8d607facdfe42406d36224f07728b8ac860","observation_id":"bc0da9e4-1860-4f29-9481-693403af7c7b","resolution":{"observed_at":"2026-08-11T19:53:23.316667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:22.454016Z","title":"3d-llm: In- jecting the 3d world into large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.454016Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:f3a21a1b49b9f81e49c38dc9e3f64bd89c680c0dbf099e9792636da84efffd19","observation_id":"596c8d96-1212-4984-93d2-282a39e49667","resolution":{"observed_at":"2026-08-11T19:53:22.454016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:23.287966Z","title":"3d-sis: 3d se- mantic instance segmentation of rgb-d scans","venue":null,"work_id":"5986ea4a-d454-44d2-a832-2353fab8caeb","year":2019},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.458692Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:cd549a708e3d2bcce9c6981767127dc846f2650d31bbd570c583932841074425","observation_id":"bd089bf1-b03f-462c-8563-3d35bf8b5767","resolution":{"observed_at":"2026-08-11T19:53:23.292681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:23.273212Z","title":"Segment3d: Learning fine-grained class-agnostic 3d segmentation without manual labels","venue":null,"work_id":"39cce893-aa44-4be3-9c1c-ac9f51095467","year":2024},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.462899Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:ea267d26117f4fc7b78a1f01613550ebad1413add034af627bafdd32d626fc03","observation_id":"454c4372-5c82-4eb0-82ff-789fa2034217","resolution":{"observed_at":"2026-08-11T19:53:23.278453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:23.255696Z","title":"Keypointdeformer: 9 Unsupervised 3d keypoint discovery for shape control","venue":null,"work_id":"e650d328-3bf6-4528-a06e-b80b265666c4","year":2021},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.467348Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:126c8ed3f81554e0fb4f78c16c400d9877efff8140f4019fbf2d5c55e65889f3","observation_id":"7d10388c-56b0-4ca7-9d4b-a6f7e0b2404c","resolution":{"observed_at":"2026-08-11T19:53:23.260658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:23.240310Z","title":"Multi-view pointnet for 3d scene understanding","venue":null,"work_id":"956aae01-4a75-4ad9-8990-c34e5e7205ca","year":2019},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.472270Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:d9abc71002dad0bd10989f7918446ffd0a28d990ceba65f498397bae0aa4070c","observation_id":"9e92acb9-cf9f-4a0e-b476-61628feddb11","resolution":{"observed_at":"2026-08-11T19:53:23.245437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:23.216322Z","title":"3d shape segmentation with projective convolutional networks","venue":null,"work_id":"9ce1587d-1c30-4cc8-96b3-f4d91924f545","year":2017},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.476533Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:ffeabbf3a33a21a19da5657369523b4c3ec718b114be513f7955e00618022085","observation_id":"d2165763-6c21-4ef5-a648-823767707ba2","resolution":{"observed_at":"2026-08-11T19:53:23.222504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:22.480826Z","title":"Berg, Wan-Yen Lo, Piotr Doll ´ar, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.480826Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:e60e898d566e0f9602c0eb8a1fbfe149d76913c82559f1f7f6392f7f45127a57","observation_id":"b4bb8479-64b2-47de-849b-dd1fa8933abe","resolution":{"observed_at":"2026-08-11T19:53:22.480826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:23.181832Z","title":"Virtual multi-view fusion for 3d semantic segmentation","venue":null,"work_id":"e88370e5-6933-4600-a2f4-5b376e0ba876","year":2020},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.485866Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:f2831f2d14f00362e106154c9c68594f5e287cfc73a30917005d8d6eff20e34d","observation_id":"0bdbfc53-5879-42ec-9077-6889205c388f","resolution":{"observed_at":"2026-08-11T19:53:23.188206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:22.490024Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.490024Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:6b6f32210ac8f8dd41430d524f79a1727238fe182b84a05ac8dd33e088253638","observation_id":"e2c303d6-0c1c-48af-bc3b-6faf051f9de1","resolution":{"observed_at":"2026-08-11T19:53:22.490024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:22.494848Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.494848Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:dcebfd42242d86d6ea8cec7f347cb27f80f7ea1b6bb827457a889f3fc67c5a65","observation_id":"eac79e8c-9230-404e-9faa-24db22f008a2","resolution":{"observed_at":"2026-08-11T19:53:22.494848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:23.141079Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"7739a51a-4b07-4a4e-92b1-0b521facdb8e","year":2024},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.499396Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:47f2cefbf994995cd9a015bcb608b0ff3bbd50ecabf1ac93e3c4b8803527cf10","observation_id":"72cfa958-02dc-4787-a8b9-329f22a9cae1","resolution":{"observed_at":"2026-08-11T19:53:23.146801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:23.126943Z","title":"3d-to-2d distillation for indoor scene parsing","venue":null,"work_id":"a6bbb72e-1a09-4d24-b041-04b61d58fc2c","year":2021},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.503575Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:5d730398840ec1d78d678134ef10c874282b407c5dd216ea20c4ece26d391706","observation_id":"fcd044aa-136b-48e1-b8d8-b2c514ab1d65","resolution":{"observed_at":"2026-08-11T19:53:23.131318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:23.106311Z","title":"Learning to segment 3d point clouds in 2d image space","venue":null,"work_id":"25288672-2a15-4c4f-9c87-15ecce9c4583","year":2020},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.508556Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:d630829465bfa43e78fa92be3d982ae5ffb222a776e8834937a9ea0d7f84056d","observation_id":"71a2aa23-2dfa-40ad-a580-96362a4f41e8","resolution":{"observed_at":"2026-08-11T19:53:23.116382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:23.089107Z","title":"Egoloc: Revisiting 3d object localiza- tion from egocentric videos with visual queries","venue":null,"work_id":"38fe8dcc-414e-4f4b-a783-3bc5fd09b7d8","year":2023},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.512221Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:54b110937ac18386e8604e2b267688c8d1f465c4b97234229373c9655d98adfb","observation_id":"378073f9-a7d3-461a-b7ef-d29ea10de51b","resolution":{"observed_at":"2026-08-11T19:53:23.093838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:23.067599Z","title":"Tracknerf: Bundle adjusting nerf from sparse and noisy views via feature tracks, 2024","venue":null,"work_id":"9687d0c2-6d97-4247-a45b-6588db9e00ea","year":2024},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.516273Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:a762b209fb3028c5cbb943e9eb2277d3a984225cdc62c8f1a1e2f814a7c27d9d","observation_id":"cc9a7285-2371-41ab-9431-02124fdbfb9b","resolution":{"observed_at":"2026-08-11T19:53:23.073993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:23.042057Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":"9756e76d-72d2-4c82-95b6-d578e9eb4c7d","year":2023},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.520516Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:735f13bc2fecb71b5a55c3b681e7958e482267b13ec12c693ae438690fe92196","observation_id":"afb41c8c-3f9f-4502-8ed9-0bd41c70655a","resolution":{"observed_at":"2026-08-11T19:53:23.048343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:23.025063Z","title":"Synthesize diagnose and optimize: Towards fine- grained vision-language understanding","venue":null,"work_id":"6fee6e07-b572-4b74-acab-5913202e8c6d","year":2024},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.525276Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:4659f00b6d77f4919345f6578036fbefb63e1583e1404b93b5b99bf47d3337d8","observation_id":"455dfd8b-5d4b-4918-ab37-1a55510ad9ae","resolution":{"observed_at":"2026-08-11T19:53:23.031427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:23.009575Z","title":"Shapellm: Universal 3d object understanding for embodied interaction","venue":null,"work_id":"1781ca6a-18d0-488c-95fa-2626eb0bc16f","year":2024},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.529670Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:ec31ba36b7c706ee0c45d8ec5d43867d8796cde90603f9adfa9f1c433a5aa468","observation_id":"46b9cf11-d76a-4e8f-9c9a-e24ae4926aa2","resolution":{"observed_at":"2026-08-11T19:53:23.014512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:22.992591Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"1a1e8fc2-27e7-4ea5-b22a-d452751c83e6","year":2021},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.534012Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:3a91931639e45be83f81b93365c05411c4f518d2098e54aeb31cc4d6d716125b","observation_id":"f1ac552a-836b-475c-b835-1e4d326928ce","resolution":{"observed_at":"2026-08-11T19:53:22.998627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-18T12:32:09.276205Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-11T19:53:22.538799Z","title":"Vision language models are blind","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.538799Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:f4f97aaf5249a80814b43d001b966a4fa9ecdcfb8d2910540b9cd87f9bdaa6c4","observation_id":"39761a1e-ab19-4615-912c-6fc91ee58bac","resolution":{"observed_at":"2026-08-11T19:53:22.538799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:22.973378Z","title":"The Strategy of Conflict: with a new Preface by the Author","venue":null,"work_id":"3a5dd125-1b3a-4271-9deb-2b4ebb92f470","year":1980},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.543453Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:628b61419bff59c494362974d25eab2936bdd18f56ff569bd0e8ebcbd771b606","observation_id":"31eb0969-dfc1-488c-8d08-2a5b9fb900fe","resolution":{"observed_at":"2026-08-11T19:53:22.979666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:22.548106Z","title":"Mask3D: Mask Trans- former for 3D Semantic Instance Segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.548106Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:f2887b1a1388c9b975ba0c0db45faed98e4bad0c7769d2bd77bc7311e3088fea","observation_id":"925db8d7-fa42-4053-8bc0-8ba92a4a68d8","resolution":{"observed_at":"2026-08-11T19:53:22.548106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:22.944497Z","title":"Skele- ton merger: an unsupervised aligned keypoint detector","venue":null,"work_id":"628ed9ff-68ee-41d7-a204-a479ac305119","year":2021},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.553206Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:e2f350c56b9be7836ad5298de48b1bcb5056e6922b7587d6c59fbba4bc0a3ce2","observation_id":"5b34724c-af20-4f5f-824e-be6c83aea78c","resolution":{"observed_at":"2026-08-11T19:53:22.949277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:22.930633Z","title":"What does clip know about a red circle? vi- sual prompt engineering for vlms","venue":null,"work_id":"6b152024-9772-450a-b961-ad1ee6f0a225","year":2023},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.557535Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:4da859c26b59db583ed6cd6efa2cb5a6366f56b9242999b8fed4cf7438e34b23","observation_id":"ed0f51ef-4cab-4922-b4fa-84dc6f63c8d0","resolution":{"observed_at":"2026-08-11T19:53:22.935249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:22.916644Z","title":"Discovery of latent 3d key- points via end-to-end geometric reasoning","venue":null,"work_id":"fab7db50-4a24-4515-9d94-df5ab321ccb7","year":2018},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.561859Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:7e5b23157a4280daca255773a9a390890b717d5484f4887f7e31e9a54cd96e0d","observation_id":"294a82b1-c7bf-42fa-8116-ce496b9ff8a2","resolution":{"observed_at":"2026-08-11T19:53:22.920888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:22.899588Z","title":"Ldls: 3- d object segmentation through label diffusion from 2-d im- ages","venue":null,"work_id":"5c3c6c94-0fa0-4c13-aa3c-c283e88b26c3","year":2019},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.566259Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:7a9f0d089852e21bb13f7f44550ca24826794ee0c3989d874e8c10a75739f61f","observation_id":"353481c6-fc2a-4a3d-854d-4c931b2e2dec","resolution":{"observed_at":"2026-08-11T19:53:22.905419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:22.885187Z","title":"Learning 3d keypoint descriptors for non-rigid shape matching","venue":null,"work_id":"6412d79d-948d-44ef-aea6-3e591d09a1a5","year":2018},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.570113Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:73c13834089269bdd73ab7f9909dfba30dea28c09d4dd81d61e5981784f0a436","observation_id":"4dc85b4c-cbf5-42e4-bb6c-dfdffee05be7","resolution":{"observed_at":"2026-08-11T19:53:22.889417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:22.866301Z","title":"Ofa: Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework","venue":null,"work_id":"b170a592-1662-4031-bbac-32adfe27acc6","year":2022},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.574293Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:8adac6f59c403eda20a9b85d9eb9003a0f3dae7ecbe330a82e940630a88ccc37","observation_id":"6b129e28-9bf1-4a00-ae2f-7e21ddee4aa1","resolution":{"observed_at":"2026-08-11T19:53:22.871745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:22.850768Z","title":"Back to 3d: Few-shot 3d keypoint detection with back-projected 2d features","venue":null,"work_id":"ee0d4215-f006-4ecc-8406-db6a7aac0c4c","year":2024},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.578146Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:b61fe960be659bf6bf64ae42be5d16d49b32e8aaf870ee3d0008231d897a100f","observation_id":"88e02f07-2665-424c-a728-65d545fac1b2","resolution":{"observed_at":"2026-08-11T19:53:22.856075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:22.834806Z","title":"Clip-dinoiser: Teaching clip a few dino tricks for open- 10 vocabulary semantic segmentation","venue":null,"work_id":"21c9b8e0-50c3-4106-92aa-fec8bba5a35a","year":2024},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.582597Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:d94fef875864667120c309c1de34293c509c123a51edb5739ba4c01be05e5155","observation_id":"b8f9746f-4395-4082-abf0-1c4842dc3551","resolution":{"observed_at":"2026-08-11T19:53:22.840684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:22.819402Z","title":"Pointllm: Empowering large language models to understand point clouds","venue":null,"work_id":"d4577b60-625a-46d2-87b9-37b80ede5406","year":null},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.586781Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:05664b7310276779e6871138709d840c3bd9b376ede9b391b4ca651699e0aec1","observation_id":"d80eac84-56fd-48b9-9b57-fb748e5681a0","resolution":{"observed_at":"2026-08-11T19:53:22.824142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:22.804954Z","title":"Ulip: Learning a unified representation of language, images, and point clouds for 3d understanding","venue":null,"work_id":"7a7ca937-8af3-4b72-a319-dbd64ae5f86d","year":2023},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.591199Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:1781ae9c06eed79e98e7ffd23e6953a03365cb3706a563fb68f0c2b058a868ee","observation_id":"203fd48a-fece-48b8-b6a6-746e9186fad3","resolution":{"observed_at":"2026-08-11T19:53:22.809708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:22.790326Z","title":"3dfeat-net: Weakly su- pervised local 3d features for point cloud registration","venue":null,"work_id":"0f0e6cce-7fd6-4919-8429-1e6d639d42ca","year":2018},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.595690Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:e3eafb056ac9f8fe7236a8222c6f35409bdf7081496f02e391dd310734a352d0","observation_id":"aef7633b-abfa-4629-9c13-1e13f93132ff","resolution":{"observed_at":"2026-08-11T19:53:22.795136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.12687","last_updated":"2020-08-07T02:07:56Z","snapshot_observed_at":"2026-08-14T12:58:21.024611Z","submitted_at":"2020-02-28T12:58:56Z","title":"KeypointNet: A Large-scale 3D Keypoint Dataset Aggregated from Numerous Human Annotations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.12687","snapshot_observed_at":"2026-08-11T19:53:22.600534Z","title":"Keypointnet: A large-scale 3d keypoint dataset aggre- gated from numerous human annotations","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.600534Z"},"links":{"cited_paper":"/paper/2002.12687","citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:2e599d91f173f1ac0a34def294e2385d8ed0a2b4614f96e7986080d76edbd3cf","observation_id":"8b26c0c1-3579-445e-97dd-21a712c5e4c7","resolution":{"observed_at":"2026-08-11T19:53:22.600534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:22.775913Z","title":"Ukpgan: A general self-supervised keypoint detector","venue":null,"work_id":"46cfecb4-3022-405f-a601-a04aa6e1d091","year":2022},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.605173Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:1e0e0b4e5190285509f48f0247fff32e88e3d4298af94b610d15ee93a63dfb3d","observation_id":"276695df-040c-467d-9e47-b5b8d2137c6d","resolution":{"observed_at":"2026-08-11T19:53:22.780211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:53:22.759768Z","title":"Good at captioning bad at counting: Benchmarking gpt-4v on earth observation data","venue":null,"work_id":"cd80d03a-b7c4-49a5-a395-3adf81064fac","year":2024},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.610243Z"},"links":{"citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:872b4c896d47b54eeaba77207426782ff9984e2110e5fed7e11300acd7177c36","observation_id":"6f564cf9-386f-447d-8be6-636e7c1d5f14","resolution":{"observed_at":"2026-08-11T19:53:22.765899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06773","last_updated":"2023-10-10T16:49:21Z","snapshot_observed_at":"2026-08-16T14:53:22.965811Z","submitted_at":"2023-10-10T16:49:21Z","title":"Uni3D: Exploring Unified 3D Representation at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06773","snapshot_observed_at":"2026-08-11T19:53:22.614137Z","title":"Uni3d: Exploring unified 3d representation at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.614137Z"},"links":{"cited_paper":"/paper/2310.06773","citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:bb1bcd9ff0e6432a2999c107a1cdb489ca51922aeb9f50aca37d4ce07da6748b","observation_id":"902ee351-1ecc-4d3f-bc1e-01008d542817","resolution":{"observed_at":"2026-08-11T19:53:22.614137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T19:53:22.619176Z","title":"List possible salient keypoints (in text)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T19:53:22.619176Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.06292"},"observation_digest":"sha256:e3f19106d390a78c1ce5cc099f4444fb7cdd423ab2967d229aef7f6def09ff32","observation_id":"9b53a1ec-0163-47b0-b616-b3d452b8b755","resolution":{"observed_at":"2026-08-11T19:53:22.619176Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.06292","last_updated":"2024-12-09T08:31:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T01:37:59.044892Z","submitted_at":"2024-12-09T08:31:57Z","title":"ZeroKey: Point-Level Reasoning and Zero-Shot 3D Keypoint Detection from Large Language Models"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":40},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2412.06292."}