{"as_of":"2026-08-18T08:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:424a4698286097e4a9bc5e0c658a8b1a563f765bff5bc3266a1ea87018d1ff48","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T05:52:39.192613Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.19774/citation-record","integrity":"/paper/2411.19774/integrity","json":"/paper/2411.19774/citation-record.json","paper":"/paper/2411.19774"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.941285Z","title":"Referit3d: Neural listeners for fine-grained 3d object identifica- tion in real-world scenes","venue":null,"work_id":"51f7b687-1ed8-4731-b369-d03279c03a0a","year":2020},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.938936Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:094854f6afd24c7e1f7294cd433585aa9b94f459f5b5ce7ebccd8b56e64197db","observation_id":"2fdef48d-5f20-42c6-9041-6b882d02dc27","resolution":{"observed_at":"2026-08-12T05:52:39.944984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.930942Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":"fcd7fe91-4fa8-4ef6-8e90-23fd3dc1474d","year":2022},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.943249Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:543ae1d4eff5669cae726754920b9a5742e5f8a402e2bcc795c214f76516c492","observation_id":"3bebe37e-82b0-458e-9d5b-fd164d7c3d56","resolution":{"observed_at":"2026-08-12T05:52:39.934549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.921082Z","title":"Meteor: An auto- matic metric for mt evaluation with improved correla- tion with human judgments","venue":null,"work_id":"9fd0b5c5-b80b-4777-a260-9f70ff2d2f5c","year":2005},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.947196Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:363f1f4f1ceb2909bf58bc7148a43e815a9b2fe34bfd234bfe2f8b679fe390df","observation_id":"bb45f7f3-7aec-4012-a808-f33480cb1ca3","resolution":{"observed_at":"2026-08-12T05:52:39.924604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.909922Z","title":"3djcg: A unified framework for joint dense captioning and visual grounding on 3d point clouds","venue":null,"work_id":"631eedff-7562-4b70-be99-1c3acf67125e","year":2022},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.950783Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:cd42390286d694544678ada587b8aca4689a99f86de8556fc530a9695373a27d","observation_id":"8a53a480-00f6-49fd-8998-0964fecd4442","resolution":{"observed_at":"2026-08-12T05:52:39.913830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.899011Z","title":"Crossvit: Cross-attention multi-scale vision transformer for image classification","venue":null,"work_id":"a1db8846-65da-4276-a64d-d6bb0cbe4f28","year":2021},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.954620Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:8dd39111d8dd4a60d7a16638cb376a1c184fa7541e87e0180a115309828a3dc6","observation_id":"a49fbc68-bb7d-451c-a990-167299085c21","resolution":{"observed_at":"2026-08-12T05:52:39.902928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.887966Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":"3e254199-a5a3-40c8-bbd9-3023bcfe937a","year":2020},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.958348Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:331bff8d939749d109d65c4269ab0d5314eb78f6732714edcc36f968a8c561bb","observation_id":"8cda7a66-f998-4172-8efe-ca1019a04bb4","resolution":{"observed_at":"2026-08-12T05:52:39.892113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.877580Z","title":"D 3 net: A unified speaker-listener ar- chitecture for 3d dense captioning and visual ground- ing","venue":null,"work_id":"2b356c5b-27e8-4faf-8a5e-ed27735ad6f8","year":2022},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.962291Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:ee03dc05621b4103a80b5fce3baf10b3ffc48085d21b712b56e68b3d0cac4306","observation_id":"0800104a-0af8-4cf3-bd6d-325df1be3d9f","resolution":{"observed_at":"2026-08-12T05:52:39.881384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.866797Z","title":"End-to-end 3d dense cap- tioning with vote2cap-detr","venue":null,"work_id":"2ca0dc57-1761-442f-a048-3dd76c8c414a","year":2023},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.965800Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:a69c9ffad12e2b78e573500c8b4b474d6146ed60f3869088de27629ca46d1349","observation_id":"66aca1ab-2e86-4b8c-a7af-42b6151a4a70","resolution":{"observed_at":"2026-08-12T05:52:39.870834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.856112Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understanding reasoning and planning","venue":null,"work_id":"6890e37c-9ad2-476c-be0e-636ca0091e62","year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.969235Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:63adf3f7a57478b1909160080a61151eeb76ef64f8774b8148b7da00ea553769","observation_id":"d0f43706-c372-4761-b5c9-52ac5cd1f4d3","resolution":{"observed_at":"2026-08-12T05:52:39.859987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.845663Z","title":"V ote2cap-detr++: Decoupling localization and describing for end-to-end 3d dense captioning","venue":null,"work_id":"a84fa6b6-7547-4cd7-8609-b5f9f8a202ce","year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.972590Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:9827c3a43aa263db1645dbfa33022884779f6e859205884a1eaea45409ad712b","observation_id":"3955fffe-6cfc-4c27-98a5-b1de0a5d3a0c","resolution":{"observed_at":"2026-08-12T05:52:39.849423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10370","last_updated":"2024-11-18T08:29:08Z","snapshot_observed_at":"2026-08-16T13:52:03.833161Z","submitted_at":"2024-05-16T18:03:41Z","title":"Grounded 3D-LLM with Referent Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10370","snapshot_observed_at":"2026-08-12T05:52:38.976162Z","title":"Grounded 3d-llm with referent tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.976162Z"},"links":{"cited_paper":"/paper/2405.10370","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:f51c3db18a910aed3b6c7bf8800c26f315072b952877f805b90b513d626e5c03","observation_id":"44351e42-213b-4930-9f53-61b35932920f","resolution":{"observed_at":"2026-08-12T05:52:38.976162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.834888Z","title":"Scan2cap: Context-aware dense cap- tioning in rgb-d scans","venue":null,"work_id":"ca67f58e-55b3-4819-99ee-bbd5b3260830","year":null},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.979952Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:d086b591898eab9ddaff351c2952de40ce6cd718566780a6f4c2a5a2c82c051f","observation_id":"8175b21e-dfb2-46dc-9ed8-2231d0e84214","resolution":{"observed_at":"2026-08-12T05:52:39.838963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.824492Z","title":"Unit3d: A unified trans- former for 3d dense captioning and visual grounding","venue":null,"work_id":"283410bb-bc62-4d97-8bc5-017394f4350e","year":2023},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.983424Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:f8ccca88427c7a5bb2acb2541e1899987a7433752afd311c65693ba1c5f05b0c","observation_id":"dcb88bb0-83f2-4c5a-b6ac-782f68f0c198","resolution":{"observed_at":"2026-08-12T05:52:39.828144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.814574Z","title":"Scannet: Richly-annotated 3d reconstructions of in- door scenes","venue":null,"work_id":"8bbead59-95ee-497c-8a33-2600aff47baf","year":2017},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.986856Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:e4814401cdced18286bd5fd415bef7e479f9a79cfebfa7f2c4bbd2d21e832b95","observation_id":"77a116e8-9795-4a95-9853-910c70b5fb65","resolution":{"observed_at":"2026-08-12T05:52:39.818310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.804009Z","title":"Objaverse-xl: A universe of 10m+ 3d objects","venue":null,"work_id":"bd3c7364-89f2-4c61-8bac-97464051da94","year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.990422Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:c85a67aaaf35f01a446d687799b0b909ba5e73febca108fa0db45c4b269c6a12","observation_id":"7c51650b-4d5d-4875-a615-f374a3d992c9","resolution":{"observed_at":"2026-08-12T05:52:39.807865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02329","last_updated":"2023-06-04T11:08:53Z","snapshot_observed_at":"2026-08-16T15:26:48.033888Z","submitted_at":"2023-06-04T11:08:53Z","title":"Multi-CLIP: Contrastive Vision-Language Pre-training for Question Answering tasks in 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02329","snapshot_observed_at":"2026-08-12T05:52:38.993892Z","title":"Multi-clip: Contrastive vision-language pre-training for ques- tion answering tasks in 3d scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.993892Z"},"links":{"cited_paper":"/paper/2306.02329","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:e7c12269d5d0279d14b2906e8c04082b41131fb5eeaedee982883b5a14c5fdd1","observation_id":"20f75eea-3e90-4471-8d06-ff8dfebe86f7","resolution":{"observed_at":"2026-08-12T05:52:38.993892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06512","last_updated":"2024-04-09T17:59:32Z","snapshot_observed_at":"2026-08-18T00:33:47.386234Z","submitted_at":"2024-04-09T17:59:32Z","title":"InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06512","snapshot_observed_at":"2026-08-12T05:52:38.997621Z","title":"Internlm-xcomposer2-4khd: A pioneering large vision-language model handling resolutions from 336 pixels to 4k hd","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.997621Z"},"links":{"cited_paper":"/paper/2404.06512","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:bda95cc65c5ea1e685d83ea5c42033c0dbb6e4ba46aa2e547da9ad39d39a58a8","observation_id":"1cee78a3-7d4d-43d4-84b0-098dcfe36cea","resolution":{"observed_at":"2026-08-12T05:52:38.997621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.793652Z","title":"Multiscale vision transformers","venue":null,"work_id":"9a7828f1-5c1b-45ab-9282-652a50f96c6f","year":2021},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.001966Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:2a89022cedffef8f27ccbc8026ac42a3ec0411de8627eb1ff2a164dab6dd2f4e","observation_id":"1c64239b-3558-4e70-9452-ebe4c70cd557","resolution":{"observed_at":"2026-08-12T05:52:39.797271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-17T15:42:36.096154Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-12T05:52:39.005828Z","title":"Scene-llm: Extending language model for 3d visual understanding and reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.005828Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:80fc20251be133c54d9ca52bbedf530e582ea4d59049b6cb5ed5c25310460aa3","observation_id":"dcb1099d-23f2-440c-b66f-07e9a055757d","resolution":{"observed_at":"2026-08-12T05:52:39.005828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01915","last_updated":"2024-07-21T02:33:00Z","snapshot_observed_at":"2026-08-16T14:13:08.826666Z","submitted_at":"2024-03-04T10:29:58Z","title":"xT: Nested Tokenization for Larger Context in Large Images","version":2},"cited_work":{"arxiv_id":"2403.01915","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.01915","snapshot_observed_at":"2026-08-12T05:52:39.358960Z","title":"xT: Nested Tokenization for Larger Context in Large Images","venue":"cs.CV","work_id":"5c5845f1-43d2-4635-8612-1952b7a28358","year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.010013Z"},"links":{"cited_paper":"/paper/2403.01915","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:4623e24f64f4adc8eff351ba2b048df7020a386c0c4baba9a7468d933437113e","observation_id":"9b5a0750-59d2-4b0e-aa30-2e993309828a","resolution":{"observed_at":"2026-08-12T05:52:39.364839Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.783121Z","title":"3d-llm: Injecting the 3d world into large language models","venue":null,"work_id":"0cc54047-176d-4f6f-8619-5991f51bb51b","year":2023},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.013879Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:d0cedf9355f6c26782df895210414dfddab28cb04317dc914f95ef4520ef97bc","observation_id":"8eb461bf-9546-4d5c-a114-7a3cf0b6e4d6","resolution":{"observed_at":"2026-08-12T05:52:39.786891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.772646Z","title":"Chat-scene: Bridging 3d scene and large language models with ob- ject identifiers","venue":null,"work_id":"d4eac773-1175-4e05-8670-6e3096d4c423","year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.017450Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:41e729363049c09057f64f3498bb366a961300cdb3bb49c5b782596da24ed6ee","observation_id":"3e922793-cc5d-4169-aefe-844f1b3f0929","resolution":{"observed_at":"2026-08-12T05:52:39.776412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.761731Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":"423e20ab-9837-4724-87ac-42e92ffe68fb","year":null},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.020975Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:a97853da3eab5eadffb1bdd0aec482ab589ceab87d48cd8d76ff654b06bc79d0","observation_id":"d68c1c9b-43a4-4cda-8fa0-b27a92065887","resolution":{"observed_at":"2026-08-12T05:52:39.765509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.750463Z","title":"Segment3d: Learning fine- grained class-agnostic 3d segmentation without man- ual labels","venue":null,"work_id":"e32aca8c-fab7-4758-a249-c56147481808","year":2025},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.024652Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:ba5328fbd1b69e435b1aaff31f2b291b6e636021a4d430e085d73d424e298140","observation_id":"ae33bd7e-9c1e-4a22-89ab-e0bcf6165772","resolution":{"observed_at":"2026-08-12T05:52:39.754704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.738633Z","title":"More: Multi-order re- lation mining for dense captioning in 3d scenes","venue":null,"work_id":"987390d5-a023-4415-af2e-db2b4a2befa4","year":2022},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.028167Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:c3b8cffb75ed0262c6ffbdd6426542facfafb8b7c55e71554532055408de5010","observation_id":"c98a4fc8-5406-4f84-9f98-44752e058333","resolution":{"observed_at":"2026-08-12T05:52:39.742845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.727188Z","title":"Context-aware alignment and mutual masking for 3d-language pre-training","venue":null,"work_id":"0e0b0dab-25eb-422c-a660-3568ee77f294","year":2023},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.031490Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:054c15c353940478f95d0cce27f1b8049e6f7297a0f8e2ad5c85731243f489f2","observation_id":"b34aa670-eaef-4be8-8fab-0fcf73de1781","resolution":{"observed_at":"2026-08-12T05:52:39.731167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.716439Z","title":"Large-scale point cloud semantic segmentation with superpoint graphs","venue":null,"work_id":"5f1b2881-a1a4-4a16-8307-24b614cda6f4","year":2018},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.035631Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:b8d4c07d6ad7f7085dbe94f5d8dccfb68197ebb4c8ce603ab265bacd1f33e447","observation_id":"b2427f95-ecda-4bf1-878a-97278b10069a","resolution":{"observed_at":"2026-08-12T05:52:39.720618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.705468Z","title":"What matters when building vision- language models? Advances in Neural Information Processing Systems, 37:87874–87907, 2024","venue":null,"work_id":"2dcb3b8d-cfba-46bb-ad3d-e3510a1cb0c7","year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.039121Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:4e27b276de5bb215dd037db6072695288d4a9441e32a9431e9d93833bad66443","observation_id":"166bf56f-6f62-4a96-ada1-10aac79273bc","resolution":{"observed_at":"2026-08-12T05:52:39.709339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.694397Z","title":"Mpvit: Multi-path vision transformer for dense prediction","venue":null,"work_id":"c992df20-b5eb-4c09-be53-b735229e2612","year":null},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.042900Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:8be21934bfba07fe7998c2975279f74e595dad1ba36274374f4cfa8fcf7b7501","observation_id":"3815e453-0e7b-404d-ab9d-14b4c1769f7e","resolution":{"observed_at":"2026-08-12T05:52:39.698170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-12T05:52:39.046581Z","title":"Llava-onevision: Easy vi- sual task transfer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.046581Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:632b7f0fef623a63a90b5c7f401232e5dcf1b3b3fcfe13550ad4927f97c031ec","observation_id":"891c454f-9b63-464e-9058-c3e6766c5b25","resolution":{"observed_at":"2026-08-12T05:52:39.046581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.683384Z","title":"Blip-2: Bootstrapping language-image pre- training with frozen image encoders and large lan- guage models","venue":null,"work_id":"371ba1e1-792b-4935-9d9e-72477c3a8f0f","year":null},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.050351Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:a6130c5ed6e4be594c560cc54e43e77e042025b9437ec0ad988e63753f098333","observation_id":"5f2d3968-9c56-464a-b206-6c96a7d7c085","resolution":{"observed_at":"2026-08-12T05:52:39.687251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-12T05:52:39.053889Z","title":"Mini-gemini: Mining the poten- tial of multi-modality vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.053889Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:0fba565f26c354b28ad5cf0037cfcbd573c3546658eed5f8745c4b9ea6a8f4f3","observation_id":"57ab0e17-348f-4018-a13d-42fe18eee0b9","resolution":{"observed_at":"2026-08-12T05:52:39.053889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.673286Z","title":"Pointmamba: A simple state space model for point cloud analysis","venue":null,"work_id":"64e544e9-1696-4221-bbf0-67ad3911f477","year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.057577Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:c7873e2a45ce7c7f632d8d4c1982d6cf55da5cac686fdcbed30dbf646d8fd8cf","observation_id":"07ed28d0-d96c-4824-8cd9-a0066e3d7fb1","resolution":{"observed_at":"2026-08-12T05:52:39.676839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.663359Z","title":"Rouge: A package for automatic eval- uation of summaries","venue":null,"work_id":"12b8c3a0-56ee-498f-badf-fb7d7aa55329","year":2004},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.061002Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:cfee80face8dc6869b27c5d304dfac3956aa9bd526eabe0b989eb2e3ff65710c","observation_id":"862269ea-21f2-400d-bc38-ae9a7e357a86","resolution":{"observed_at":"2026-08-12T05:52:39.666919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.652983Z","title":"Llava- next: Improved reasoning, ocr, and world knowledge,","venue":null,"work_id":"36187371-9a85-45cf-80b7-ab18164c134b","year":null},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.064701Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:991c4b20d2faa5278b08b25a5170bd799003fb85d905548d67b541e352b4d3b4","observation_id":"49c48ae7-fbda-4c96-afc6-fe2df78fc7b8","resolution":{"observed_at":"2026-08-12T05:52:39.656619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.068119Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.068119Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:69be60180a2435ca867d8d1e00a78860797373ca3302bec9abedab283c6e6a3a","observation_id":"45e634a6-c7be-4f87-af45-2ffa100af226","resolution":{"observed_at":"2026-08-12T05:52:39.068119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.636570Z","title":"A convnet for the 2020s","venue":null,"work_id":"fd31aaed-fbb7-45a3-87c9-cdfe727afbf5","year":null},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.071426Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:3cc32bed776bec13cc2d8453f825ad3bbcb359954952c1bdee458309832d44cd","observation_id":"a3681f95-181e-4ec4-b95e-44c8ee7c47fc","resolution":{"observed_at":"2026-08-12T05:52:39.640650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-12T05:52:39.074951Z","title":"Fixing weight decay regularization in adam","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.074951Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:3da0c83a71891f88aba4335b4894637169e5c996ba41ba6c9ce79ca5581fe17f","observation_id":"22d1efa9-ccbe-4580-afa0-82081e8d86eb","resolution":{"observed_at":"2026-08-12T05:52:39.074951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-12T05:52:39.078828Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.078828Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:7f3902c89b17bd828ac6f01254711d0e3cb36a039c2cf2b2aa66e8a65d1c8279","observation_id":"436a7c1b-a225-465c-8ada-000d3831bd31","resolution":{"observed_at":"2026-08-12T05:52:39.078828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.626029Z","title":"Complete 3d relationships extraction modality alignment network for 3d dense captioning","venue":null,"work_id":"7f4a3be8-d907-4e5d-ace1-d4db78a7da2f","year":2023},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.082544Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:6da3c849855a79f8f64545f8f034711989908e3df1da5bc85ad8e639cf7d7d87","observation_id":"e6bc15ef-8723-48f1-9373-49c9fabb3777","resolution":{"observed_at":"2026-08-12T05:52:39.629995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.615555Z","title":"Fast march- ing farthest point sampling","venue":null,"work_id":"fff99eca-a674-4841-b9d5-2317317f2a56","year":2003},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.085901Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:41870b9cb9ad65dbbd67c28f7eb526c82d9bbec14c9683786e449cd5a3eac9b3","observation_id":"fcb7ea36-d56e-4ff6-bfb8-8b15637dd329","resolution":{"observed_at":"2026-08-12T05:52:39.619272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.605316Z","title":null,"venue":null,"work_id":"f46db892-6f29-4b2c-84c3-8e86ccd1660c","year":2001},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.089388Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:24a507a957ac214f9e1499e2db0825b40486564f12538df6dea431b7f0a5708b","observation_id":"92c869c7-040a-4d31-a968-2efc09371682","resolution":{"observed_at":"2026-08-12T05:52:39.608796Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.594854Z","title":"Bleu: a method for automatic evalu- ation of machine translation","venue":null,"work_id":"690190cc-4ec7-4162-aacf-76a0cd401e44","year":null},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.092970Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:a01cc1371986bddadd1f145e01cc13c49a70aad824a0cf77c8b8acce07edecb7","observation_id":"f090482c-65cf-4746-b1fe-0121207eb516","resolution":{"observed_at":"2026-08-12T05:52:39.598612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.584461Z","title":"Clip-guided vision-language pre-training for question answering in 3d scenes","venue":null,"work_id":"10097e35-025a-498f-92e2-24189a8f7c6b","year":2023},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.096376Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:157336b67aa33bbf5a9018ab4e649105d613cba05b3aa52bbc188c45e60b4e69","observation_id":"49d35b74-f1a9-4910-a2c3-23781e405292","resolution":{"observed_at":"2026-08-12T05:52:39.588087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.573704Z","title":"Pointnet++: Deep hierarchical feature learn- ing on point sets in a metric space.NeurIPS, 30, 2017","venue":null,"work_id":"af321c6b-783e-4c17-a201-c683f0b17530","year":2017},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.099843Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:e7d9834258770e2c5aafa439c2bc1b55ec339b35e6dcbefb018b55bafa570096","observation_id":"47f23876-4fb7-4129-b706-0d6f4fdd29f2","resolution":{"observed_at":"2026-08-12T05:52:39.577568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.563512Z","title":"Shapellm: Universal 3d object understanding for embodied interaction","venue":null,"work_id":"02bee81a-4f48-40c3-8f2a-b514c3c0ba86","year":null},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.103550Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:bc9844989c3ed793867f68af732cdc7c40273db1d3964ce71d7ee443e23e2f95","observation_id":"1ba314a6-8f16-491e-924c-a425c22ac426","resolution":{"observed_at":"2026-08-12T05:52:39.567216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.553545Z","title":"Semantic segmentation for real point cloud scenes via bilateral augmentation and adaptive fusion","venue":null,"work_id":"9f061cfa-f6de-47e4-ada1-823ee156fb1f","year":2021},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.106889Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:09f90f22b427b91fa4ebf9b6b7bc2635767aa09f2077164b5b3ed6f2f4933e28","observation_id":"e5e3eedb-aff2-44c0-a154-aeba247889b9","resolution":{"observed_at":"2026-08-12T05:52:39.557336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.544049Z","title":"Radford, J","venue":null,"work_id":"578952d1-3c2e-4094-a2c2-2da3d7609105","year":2021},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.110204Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:1fef342a7f7f7ac4cd2b29f6c0c91c8a37a5f1c31e7ddb56a90dec2dc0d643b2","observation_id":"3fa46caf-32f6-4495-a813-dbeb9725378f","resolution":{"observed_at":"2026-08-12T05:52:39.547462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.534216Z","title":"Hiera: A hierarchical vision trans- former without the bells-and-whistles","venue":null,"work_id":"f6a013cc-9738-4e79-ad3c-e4aeefd571aa","year":2023},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.114337Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:5e0f4572a592ce689beb9fbb37aa1268dae2669e6737bfd45d658150e8e72ad4","observation_id":"6f4d9b39-2c82-4ac6-a96f-be4c60a32e71","resolution":{"observed_at":"2026-08-12T05:52:39.537901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.523938Z","title":"Hilbert’s space-filling curve","venue":null,"work_id":"652db875-7172-4e2c-877e-5bfe360fa305","year":1994},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.117888Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:cf6162cbe211f5c1f24599d680ef64371a81b1636f422645464e5b737e674413","observation_id":"a26cabd5-09b1-4616-a948-806d337e4c3c","resolution":{"observed_at":"2026-08-12T05:52:39.527618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.512830Z","title":"When do we not need larger vision models? In ECCV, pages 444–462","venue":null,"work_id":"90b16733-a544-43e2-b593-dc642e3bd6a5","year":2025},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.121579Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:67f68abf51871923ed155fc55b85fed866c4df20075d566de10a718a1c181853","observation_id":"327e157f-0927-44d3-9405-b87d983e7df8","resolution":{"observed_at":"2026-08-12T05:52:39.516774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.501969Z","title":"Fourier features let networks learn high frequency functions in low dimensional domains","venue":null,"work_id":"ff756d66-994e-470b-a47c-8c07d63a2d84","year":2020},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.125221Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:2505f53adc8cfe0cf7f7b373addb6f5c363d1b6051ee314512d722433bd83c3e","observation_id":"e5d80c2a-f6cf-44dc-b9fa-a49b1bc913fd","resolution":{"observed_at":"2026-08-12T05:52:39.505868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.490391Z","title":"Minigpt-3d: Efficiently aligning 3d point clouds with large language models using 2d priors","venue":null,"work_id":"2b02ec07-42fd-4605-8441-7ba2712ebb70","year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.128648Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:b226701d358b50af54b4dc1279d5560df29253cd1803f7168ddf632658394de1","observation_id":"e20b9a0c-ad8f-4780-8fdf-33eed0a6333f","resolution":{"observed_at":"2026-08-12T05:52:39.494243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T05:52:39.131983Z","title":"Llama: Open and effi- cient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.131983Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:89a3b1a9de518595fec74e27f80a5c7cbcd2492afac1cf291c6ef90fb0a8dda3","observation_id":"f5b54a9f-b3dd-436c-a19c-14434509e455","resolution":{"observed_at":"2026-08-12T05:52:39.131983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.479831Z","title":"Cider: Consensus-based image descrip- tion evaluation","venue":null,"work_id":"f82eb673-89dd-4d33-9f5c-bcecf09dfd4b","year":2015},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.136633Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:74f158f601a9a80ecc4b4c47aa1e1035ef12884236a7ba1aa783767fe79e66ff","observation_id":"d2ba5ada-ad0e-4158-b8e1-4df9317c44d2","resolution":{"observed_at":"2026-08-12T05:52:39.483560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.10688","last_updated":"2022-04-22T13:07:37Z","snapshot_observed_at":"2026-08-17T01:11:42.292456Z","submitted_at":"2022-04-22T13:07:37Z","title":"Spatiality-guided Transformer for 3D Dense Captioning on Point Clouds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.10688","snapshot_observed_at":"2026-08-12T05:52:39.140170Z","title":"Spatiality-guided transformer for 3d dense captioning on point clouds","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.140170Z"},"links":{"cited_paper":"/paper/2204.10688","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:f98018c1501707b59942fc86086a41cc67a48a93cf05951e996056ac1370e43c","observation_id":"1e2b1224-b8ea-42d2-8d51-134652b2feb0","resolution":{"observed_at":"2026-08-12T05:52:39.140170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.468990Z","title":"Octformer: Octree-based trans- formers for 3d point clouds","venue":null,"work_id":"704c5002-20c2-4c6f-9807-0635816283b5","year":null},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.143764Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:0f3fbb6a8eedf357031c5e6bd5e9e0ef7e2f8359eefb0a3a0d4ce0b5ac53d018","observation_id":"4bddd281-ac88-48e7-a68c-e4a0dacf1553","resolution":{"observed_at":"2026-08-12T05:52:39.472817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.457802Z","title":"Divergence-augmented policy opti- mization","venue":null,"work_id":"027c0ef4-de36-419d-9398-ab0d0272090f","year":2019},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.147302Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:9370ed22fcfeee4dd9c511ead0ac109b0f6b2001e78ece98236a9adb602c9b4f","observation_id":"9792d6fa-e17f-48c6-bb96-7b25d6169f04","resolution":{"observed_at":"2026-08-12T05:52:39.461616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08769","last_updated":"2023-08-17T03:52:15Z","snapshot_observed_at":"2026-08-16T15:07:56.298993Z","submitted_at":"2023-08-17T03:52:15Z","title":"Chat-3D: Data-efficiently Tuning Large Language Model for Universal Dialogue of 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08769","snapshot_observed_at":"2026-08-12T05:52:39.150873Z","title":"Chat-3d: Data-efficiently tun- ing large language model for universal dialogue of 3d scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.150873Z"},"links":{"cited_paper":"/paper/2308.08769","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:3e0c7c7cd33e1b95144822845c7fcf6645289f3e64bed70763ad9a0f09c2a39e","observation_id":"cec68e10-d158-4dfe-a7c9-b7f71c3ed394","resolution":{"observed_at":"2026-08-12T05:52:39.150873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.446776Z","title":"Point transformer v3: Simpler faster stronger","venue":null,"work_id":"d0756478-08ae-480d-b630-1561218cfe56","year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.154739Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:fe93b5013238f1853a2ca2aad8d9cd0c75c699407d8ecafb3a1a9bd088432033","observation_id":"7e7229e0-0a62-4245-bd97-d707cb79d53d","resolution":{"observed_at":"2026-08-12T05:52:39.450796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16911","last_updated":"2024-09-06T22:45:43Z","snapshot_observed_at":"2026-08-16T15:04:12.996129Z","submitted_at":"2023-08-31T17:59:46Z","title":"PointLLM: Empowering Large Language Models to Understand Point Clouds","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16911","snapshot_observed_at":"2026-08-12T05:52:39.158355Z","title":"Pointllm: Empower- ing large language models to understand point clouds","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.158355Z"},"links":{"cited_paper":"/paper/2308.16911","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:265cfdb64c7ab7f669e0a4a046eff4f35cf10ac0dba79486e01bbd29d31178f9","observation_id":"e9cb2987-b74a-4121-a0b9-134b25bc07f9","resolution":{"observed_at":"2026-08-12T05:52:39.158355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-12T05:52:39.162003Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution im- ages","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.162003Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:08ef145cc1e195d0e0dd1bed1297eb32b11d08893333e7fb870d94d78c9badfc","observation_id":"5647cc14-a07e-43cd-b4f1-8ea8d72e7d65","resolution":{"observed_at":"2026-08-12T05:52:39.162003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.435125Z","title":"Focal attention for long-range interactions in vision transformers","venue":null,"work_id":"caf1e58f-5f6a-445a-9168-25e057dc109f","year":2021},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.165917Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:fcdaab23632b4463bec85817e8b5e8f777f21082e67bb25983d54880ecf6339b","observation_id":"db89f7c2-540a-4a9a-96cc-3f3a53e6333a","resolution":{"observed_at":"2026-08-12T05:52:39.439052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05132","last_updated":"2025-03-20T23:06:14Z","snapshot_observed_at":"2026-08-16T19:30:31.655964Z","submitted_at":"2024-06-07T17:59:59Z","title":"3D-GRAND: A Million-Scale Dataset for 3D-LLMs with Better Grounding and Less Hallucination","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05132","snapshot_observed_at":"2026-08-12T05:52:39.169470Z","title":"Fouhey, and Joyce Chai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.169470Z"},"links":{"cited_paper":"/paper/2406.05132","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:cac87271bbf44be3b46ebd70a0d3f157f55551da5c898ed3c70ad6adf6712b41","observation_id":"bc72bc50-87ed-4809-9aa5-94633375f916","resolution":{"observed_at":"2026-08-12T05:52:39.169470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08359","last_updated":"2022-11-29T01:51:28Z","snapshot_observed_at":"2026-08-16T17:34:20.104698Z","submitted_at":"2021-12-15T18:59:59Z","title":"3D Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08359","snapshot_observed_at":"2026-08-12T05:52:39.173304Z","title":"3d question answering","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.173304Z"},"links":{"cited_paper":"/paper/2112.08359","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:4e8e5b8094cc308370ada3a6e97574f409877c5ecb4bad06a2c0f08e51e7c812","observation_id":"ab51129a-acd7-4fe2-af20-68f6ab46e5b5","resolution":{"observed_at":"2026-08-12T05:52:39.173304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-12T05:52:39.176862Z","title":"Opt: Open pre-trained transformer language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.176862Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:614bf7683085ed65862f5fa83737459cb5b03b1090e9f18792461038463e052e","observation_id":"387a662b-e323-4815-9365-ae8d9956435e","resolution":{"observed_at":"2026-08-12T05:52:39.176862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.423952Z","title":"Toward explainable 3d grounded visual question answering: A new benchmark and strong baseline","venue":null,"work_id":"54f9b455-4551-477a-9234-f5df180b9eb3","year":2022},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.180955Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:bec1360a1b3f1486fa52afebbb8a035f7952a024c4176d20661f48044fa846e9","observation_id":"8e77bb5b-be83-460b-9021-a014b52180d1","resolution":{"observed_at":"2026-08-12T05:52:39.427809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03925","last_updated":"2022-10-08T05:33:00Z","snapshot_observed_at":"2026-08-16T16:25:57.515398Z","submitted_at":"2022-10-08T05:33:00Z","title":"Contextual Modeling for 3D Dense Captioning on Point Clouds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03925","snapshot_observed_at":"2026-08-12T05:52:39.184629Z","title":"Contextual modeling for 3d dense captioning on point clouds","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.184629Z"},"links":{"cited_paper":"/paper/2210.03925","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:12bb278fe5a80c69810d07b22beae51d245ad2888625e1e705b6dd4b0a7d9047","observation_id":"0c7a2a0e-d478-49f0-a810-a42a05df7657","resolution":{"observed_at":"2026-08-12T05:52:39.184629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18125","last_updated":"2025-04-27T06:50:23Z","snapshot_observed_at":"2026-08-16T13:15:01.097068Z","submitted_at":"2024-09-26T17:59:11Z","title":"LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18125","snapshot_observed_at":"2026-08-12T05:52:39.188568Z","title":"Llava-3d: A simple yet effec- tive pathway to empowering lmms with 3d-awareness","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.188568Z"},"links":{"cited_paper":"/paper/2409.18125","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:79c432fe5111451b1bae130072cfd243ddf93b164ad05badd9f937f8efadc40a","observation_id":"a3dcffa2-bb4c-480d-a93b-fb0497b7a48e","resolution":{"observed_at":"2026-08-12T05:52:39.188568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.412398Z","title":"de- scribe","venue":null,"work_id":"7801c4a5-b01a-452d-a35a-34a90457c16d","year":2023},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.192613Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:0a77a0128c30697ffd7ce23f97e24d59933c2bd6f0ef124eaa813c59512a1757","observation_id":"189f9e8f-1439-4dae-b2f5-e7293131e7b6","resolution":{"observed_at":"2026-08-12T05:52:39.416264Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":1,"verified_fuzzy":48},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2411.19774."}