{"as_of":"2026-08-15T12:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3201532552b974b5efb5640db70487af7316ae3fba682918028126c9664ce808","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:32:14.153900Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:26:40.646360Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T15:26:42.549976Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"cited_work":{"arxiv_id":"2411.10639","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.10639","snapshot_observed_at":"2026-08-07T15:26:42.549976Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","venue":"cs.CV","work_id":"12ce3c81-0dcd-42e7-8621-18a678067cc1","year":2024},"citing_paper":{"arxiv_id":"2505.18198","last_updated":"2025-05-21T05:14:11Z","snapshot_observed_at":"2026-08-13T02:46:54.257736Z","submitted_at":"2025-05-21T05:14:11Z","title":"LTDA-Drive: LLMs-guided Generative Models based Long-tail Data Augmentation for Autonomous Driving","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:26:40.646360Z"},"links":{"cited_paper":"/paper/2411.10639","citing_paper":"/paper/2505.18198"},"observation_digest":"sha256:52f4818ded77183b5a257bf4e9070ee8a0f48d559f88d5f761ef1188187d0864","observation_id":"15cb63b7-9c6a-4f8c-9bbf-8c1e62f2a4a6","resolution":{"observed_at":"2026-08-07T15:26:42.627301Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.10639/citation-record","integrity":"/paper/2411.10639/integrity","json":"/paper/2411.10639/citation-record.json","paper":"/paper/2411.10639"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.674184Z","title":"METEOR: An Au- tomatic Metric for MT Evaluation with Improved Correla- tion with Human Judgments","venue":null,"work_id":"cbd4c647-e811-49ae-89aa-84f8b89de12c","year":2005},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:13.996470Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:d7b4ab73be9475a32b8e0af3bfc28bf2edef7d98f02272d6a02ce48522b488fa","observation_id":"a286a36e-cfde-4af3-96e6-193e8123dffc","resolution":{"observed_at":"2026-08-12T19:32:14.678020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.664679Z","title":"Lang, Sourabh V ora, Venice Erin Liong, Qiang Xu, Anush Krishnan, Yu Pan, Gi- ancarlo Baldan, and Oscar Beijbom","venue":null,"work_id":"f8af6d60-5742-4694-acd5-ac5978f015dd","year":2020},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.000851Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:a4c3caf114f1bfca1b03f6af5ffcb6616282b7548a5ebd9214cedcc5892c0927","observation_id":"a97ef46c-5d46-4cbe-8662-c239dd29ab29","resolution":{"observed_at":"2026-08-12T19:32:14.668004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.654438Z","title":"In- ternLM2 Technical Report","venue":null,"work_id":"b0b533d7-750f-4072-91d8-7df1936c2b18","year":2024},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.005106Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:06957ffbdbefb5f0585f4bb3662cb3d85707fc98ddad183d7b3d4f713c327dc6","observation_id":"26319c7d-d4da-4e16-bb57-390c2ef5d34a","resolution":{"observed_at":"2026-08-12T19:32:14.657779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.643925Z","title":"Rehg, and Chao Zheng","venue":null,"work_id":"93fd8a06-006c-4e4c-8f14-8b94bac43fbe","year":2024},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.008256Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:17f43e56e40ee1ae3553ac796fc1cf0e6fe1eb762662ae835ec05c1d2b463381","observation_id":"392df1de-3ed1-41e6-9cc0-64cb5b00bfe9","resolution":{"observed_at":"2026-08-12T19:32:14.646923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.632880Z","title":"End-to-end Autonomous Driving: Challenges and Frontiers","venue":null,"work_id":"bb98b390-b12f-4236-a79d-d3ae421d5a94","year":2024},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.011154Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:0fdded02cf0fd2c4034b06fb222a31d4e9ee075c6eb4d4fb718b751c06dc6064","observation_id":"078278d7-8649-4397-981e-761ba0ffbd8f","resolution":{"observed_at":"2026-08-12T19:32:14.636171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.622987Z","title":"End-to-End 3D Dense Captioning with V ote2Cap-DETR","venue":null,"work_id":"b8c06054-03d9-42ae-8245-e91b8bfd8c4e","year":2023},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.014244Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:ed41d7baeff6b08a766116fdec93260584b62d964e637562368e0b7f507a0434","observation_id":"2383dca6-332b-4ca5-b93c-5055a0f462aa","resolution":{"observed_at":"2026-08-12T19:32:14.626594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.612606Z","title":"V ote2Cap-DETR++: Decoupling Localization and Describ- ing for End-to-End 3D Dense Captioning","venue":null,"work_id":"32afbf62-60fa-4a2c-b673-765e5ccc8d9d","year":2024},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.017253Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:1806c0329e5aa6fb1859a8300ba7db4cded37d25af669951ca498a1f0e8a42bb","observation_id":"08695401-f447-4a32-8da9-4c07c9044e04","resolution":{"observed_at":"2026-08-12T19:32:14.615883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.602024Z","title":null,"venue":null,"work_id":"cf8ddc38-d4c1-4ff3-a702-d7e929af5f4a","year":2021},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.019838Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:64efe6a35f0971cb69268e5229b7a1974f3e11828296fd2b51fbfddfcc843e8a","observation_id":"3f141258-fb25-487c-a759-907d35a498bd","resolution":{"observed_at":"2026-08-12T19:32:14.605993Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.591839Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","venue":null,"work_id":"38bf6de1-71bf-4020-b945-31c8f3bcd644","year":null},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.022399Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:6d014c2b7ea1d5d0e70494b8e8b6fde533fc91fbdca7051825cf34a4ed3cfea8","observation_id":"725fbf58-ff26-4b3f-a44c-e0000d374a51","resolution":{"observed_at":"2026-08-12T19:32:14.595277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.581176Z","title":"ST-P3: End-to-end Vision-based Au- tonomous Driving via Spatial-Temporal Feature Learning","venue":null,"work_id":"8be7effe-a903-4aa9-b66e-afffaf4dff3b","year":2022},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.025125Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:3a185092639b7935c86e7ec7afafd42771bb33145dc5d584e32a4125ffcfb9ca","observation_id":"eeb2e83e-8c6f-48ed-a4fc-623f43e65fc7","resolution":{"observed_at":"2026-08-12T19:32:14.585277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.569102Z","title":"Planning-oriented Autonomous Driving","venue":null,"work_id":"74651574-f660-493b-a118-e831fea10bb7","year":2023},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.028002Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:31263d0602a602b4c00fb4c1900c3aa17bec047766569167f3b8f2a181304055","observation_id":"639306cd-9d7b-41d7-bcab-0527f4bff043","resolution":{"observed_at":"2026-08-12T19:32:14.573135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.556751Z","title":"EMMA: End-to-End Multimodal Model for Autonomous Driving","venue":null,"work_id":"4c1a6188-a6c0-40be-9937-201cedd93eb2","year":2024},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.030641Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:7cab90ecef6bac993691dd37797eafd4e72883c10209903632cb3abe99fe1140","observation_id":"3d2df9a6-f293-4597-b19c-db9c863ad356","resolution":{"observed_at":"2026-08-12T19:32:14.561424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.544665Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":null,"work_id":"30ec2d03-7f9a-4b8f-ac50-33efbbe74c7c","year":2021},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.033178Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:93326f05c4e0ebd9bc2cffb56aa6cb4e2c9abd2d28b8328b0968600a6c1fa415","observation_id":"3e7051d3-6095-4831-8cad-9a075df5a55a","resolution":{"observed_at":"2026-08-12T19:32:14.548734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.532721Z","title":"Bench2Drive: Towards Multi-Ability Bench- marking of Closed-Loop End-To-End Autonomous Driving","venue":null,"work_id":"48b7c8ca-ba79-4bf2-8e15-63591880f289","year":2024},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.035757Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:54a9e49c914434495dfdeea3312a48fef729ea5490392110d30f4ff3c61e3c7e","observation_id":"6eae8335-299d-47df-8695-6948b558ddc4","resolution":{"observed_at":"2026-08-12T19:32:14.536434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.521479Z","title":"V AD: Vectorized Scene Representation for Efficient Autonomous Driving","venue":null,"work_id":"e86830b5-a6af-4cf4-9231-5942817f3d64","year":2023},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.038527Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:cc16817b41dba213da6fd1f7398f3d342748d2a586899722149bbd2556a0bbd5","observation_id":"b5d55b94-5677-48ac-84af-79cc313a74a4","resolution":{"observed_at":"2026-08-12T19:32:14.524840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.509415Z","title":"TOD3Cap: Towards 3D Dense Captioning in Outdoor Scenes","venue":null,"work_id":"09b08389-468f-4bf7-9a6f-0281c7d280bf","year":2024},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.042488Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:24ddabe91f2b39b631188a8ca40f59bee0831f3d1f0c0fcb3f010df2ae485be3","observation_id":"4ef75481-1973-423b-b96c-e103f3384c43","resolution":{"observed_at":"2026-08-12T19:32:14.513422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.497408Z","title":"MaPLe: Multi-modal Prompt Learning","venue":null,"work_id":"50ae8aab-8b47-48af-a36a-593e325ba21b","year":2023},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.046547Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:78cbb8e42c347193cf046728033141d569bb8fc5227ea01058e3365001c8dc44","observation_id":"add425f1-8a70-43f9-b8e0-5f6a88b087af","resolution":{"observed_at":"2026-08-12T19:32:14.501930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.486005Z","title":"Driving Everywhere with Large Language Model Policy Adaptation","venue":null,"work_id":"57018c5f-c1a9-40f9-895e-162bb498aac7","year":null},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.050336Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:0596ccad36fb8b6ed7270d55488944379566ca282aa218997d16d77cb98ab52c","observation_id":"c973eec2-addd-46ee-b60a-d7c0b968bebd","resolution":{"observed_at":"2026-08-12T19:32:14.490592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.054228Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.054228Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:cc1afd5bc4e00a24557f5ed95be21321737a7f1a03f0a0982c62826063db3fe3","observation_id":"8ad6e984-59ac-44a6-b104-7692462b5724","resolution":{"observed_at":"2026-08-12T19:32:14.054228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.469887Z","title":"BEVFormer: Learning Bird’s-Eye-View Representation from Multi- Camera Images via Spatiotemporal Transformers","venue":null,"work_id":"e516e627-e2de-4d5d-a162-20cdc77289d9","year":null},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.057382Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:8eadb1fbcd2f3db3ebe991c21e2d4b7318ceb5aa699067982d5c5adf9a881081","observation_id":"9a2b9821-72c2-4293-bcd9-944f4330e743","resolution":{"observed_at":"2026-08-12T19:32:14.473009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.461739Z","title":"AIDE: An Automatic Data Engine for Object Detection in Au- tonomous Driving","venue":null,"work_id":"6ab87776-1cd9-459e-a21c-f7b8202e7d13","year":2024},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.060336Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:8d5b136721f2d8c73a3587a1f1412e48111bad2010d761bfb4ae366fa839a0ed","observation_id":"e8b4156f-a2bb-4245-9c97-32dff58c00b6","resolution":{"observed_at":"2026-08-12T19:32:14.464892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.452468Z","title":"BEVFusion: A Simple and Robust LiDAR-Camera Fusion Framework","venue":null,"work_id":"b99f1af9-11e0-4b6a-b314-50754b609ced","year":2022},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.063709Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:58eff003e579a7e789aa205d17e4b3d24dadc825b2455df3592c91a1e1161cc2","observation_id":"112919d5-ea2f-41c4-b779-f12bf4ebf32a","resolution":{"observed_at":"2026-08-12T19:32:14.455587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.442484Z","title":"ROUGE: A Package for Automatic Evalu- ation of Summaries","venue":null,"work_id":"812198a4-9be0-4ef0-96d9-2f61616e8e62","year":null},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.066998Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:3f2c5e9f389c406a9d2660fbb2d919e39c601e394ccc89f5a2c4dbab37c822dc","observation_id":"05387a8e-eaff-451a-aee2-b99ef078be98","resolution":{"observed_at":"2026-08-12T19:32:14.446019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.431686Z","title":"BEVFusion: Multi- 9 Task Multi-Sensor Fusion with Unified Bird’s-Eye View Representation","venue":null,"work_id":"91d9bad0-acea-4a7c-ae26-cc8fc3682e9d","year":2023},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.070146Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:6bbc9e3517dbf999e692c044ce85a63758d6310720e16d1502d731a826c18398","observation_id":"8f1320ff-62c4-4e12-8bb3-913be02de2e5","resolution":{"observed_at":"2026-08-12T19:32:14.435380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.421083Z","title":"The Llama 3 Herd of Models","venue":null,"work_id":"b2e63c0f-3e48-4b65-ae5a-a624dc9475e6","year":2024},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.072938Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:007f34254745dffedb43f5229b5596ce4879b70e345cb2cc0c7e092b88a36d7a","observation_id":"a593da1f-e0e1-455b-aa18-400bd765c6bd","resolution":{"observed_at":"2026-08-12T19:32:14.424061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.410659Z","title":"Position: Prospective of Autonomous Driving - Multimodal LLMs, World Mod- els, Embodied Intelligence, AI Alignment, and Mamba","venue":null,"work_id":"50777cd1-b1e4-473e-859b-8479cc091e3c","year":2025},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.075614Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:8b443a414cad25f0114838ab62b8fc3e5a61dd4691e244accd3a82e12e1200cb","observation_id":"e3e59937-63d6-4ee4-aed8-189270d8515c","resolution":{"observed_at":"2026-08-12T19:32:14.414657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.398110Z","title":"DRAMA: Joint Risk Localization and Cap- tioning in Driving","venue":null,"work_id":"17d74b0d-7075-48a0-a4c1-d22e20248dc7","year":2023},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.078428Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:ffc90ea84a79172c619f6854e4062b6dd9438dcfe31a6d67d8ef34687800a909","observation_id":"5dc38668-dbe9-43c5-a0e9-f221c782358c","resolution":{"observed_at":"2026-08-12T19:32:14.402369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.386893Z","title":"A Language Agent for Autonomous Driving","venue":null,"work_id":"08799025-b3c4-4b5b-bd30-807063711656","year":2024},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.081995Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:e9e1d9e9c54ac46fcbbcbd926d2a9a8c60b823c9de1ad87dd0d7b62d3ba7478e","observation_id":"7d5236cf-d935-436f-a806-143825c5f2d1","resolution":{"observed_at":"2026-08-12T19:32:14.390258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.376831Z","title":"LingoQA: Video Question Answering for Autonomous Driving","venue":null,"work_id":"80c0acea-658f-4769-8bdc-dbcf243fa4ef","year":2024},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.084838Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:17452b7ccfb4a139d866cb6709b9bb55f8f901560ca18a1135671566042a588b","observation_id":"77691cd2-3185-49e6-8cd7-82aec81b005a","resolution":{"observed_at":"2026-08-12T19:32:14.380841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.366461Z","title":"Qi, Runzhou Ge, Kratarth Goel, Zoey Yang, Scott Ettinger, Rami Al-Rfou, Dragomir Anguelov, and Yin Zhou","venue":null,"work_id":"b527b336-5408-47a0-be86-34c074a2e0ac","year":2024},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.088646Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:65fe94a507c5a519ca4ccef8cd79cd3da0629b028709c8cf92e5224a190da216","observation_id":"10c87793-6202-458d-8091-d7946dc0a88b","resolution":{"observed_at":"2026-08-12T19:32:14.369688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.356337Z","title":"Bleu: a Method for Automatic Evaluation of Machine Translation","venue":null,"work_id":"345f4517-5ba1-4a28-9064-3b3c6c8a6fff","year":2002},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.092525Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:38ec7744091decc46aa2c54c9bc52697b5d06d132e4eb6f4392dae3160be4385","observation_id":"278b70f0-6816-47fb-ba74-170171150e36","resolution":{"observed_at":"2026-08-12T19:32:14.359513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.347380Z","title":"NuScenes-QA: A Multi-Modal Visual Ques- tion Answering Benchmark for Autonomous Driving Sce- nario","venue":null,"work_id":"0b620c05-9d1a-4c97-bd88-9d67407a5ba3","year":2024},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.096584Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:435c002041c487285125a902fb25b6315e691f18eaa736a2b0d1bf910f3bb343","observation_id":"edc1093e-a856-4046-b73b-c4f15788fce1","resolution":{"observed_at":"2026-08-12T19:32:14.350818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.099810Z","title":"Learning Transferable Visual Models From Natural Language Supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.099810Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:8b8316b65fd420ca115a71d11f48f222aa16d043c61683965bf2bf04666e75e8","observation_id":"3b372ac5-7d9f-4f94-83c3-c87a1c3e63e0","resolution":{"observed_at":"2026-08-12T19:32:14.099810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.328704Z","title":"DriveLM: Driving with Graph Visual Question Answering","venue":null,"work_id":"f2c3029a-014b-4b6c-8f3b-939f68c8cf0b","year":2024},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.103303Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:c5afbf610107562bf23f8a1605ec3e095337053785f6cc1333fb34deaf6ffede","observation_id":"b7515c18-3b16-4d13-b943-91a56a458a50","resolution":{"observed_at":"2026-08-12T19:32:14.332725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.320042Z","title":"Tokenize the World into Object-level Knowledge to Address Long-tail Events in Autonomous Driving","venue":null,"work_id":"dbe25e31-6f63-4fa3-9eef-4a399ff2eafc","year":2024},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.106140Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:c1baed57d0547b61c8c365f649db3652bf1386b7d7c2de07c567b1be1f20d311","observation_id":"5bd17e93-fd3f-43a4-b6bb-1e630851895d","resolution":{"observed_at":"2026-08-12T19:32:14.323116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.310953Z","title":"DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models","venue":null,"work_id":"2e6f2652-872c-4969-82b2-f5dbdeb1af99","year":2024},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.109436Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:22acc8f0c11f5fb7db197cd4428a46069525bed9f58c1e2828f84dfade545c0b","observation_id":"11f0f184-521b-4f9e-b466-6313709c4412","resolution":{"observed_at":"2026-08-12T19:32:14.314317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.303110Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"775dc52a-6663-4847-9144-c26d235fe394","year":2015},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.112332Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:c104ff7a66841fbe3f2e2f29ada7666e27f5c2269975b87ef561106bcfd5a02b","observation_id":"8e0e775d-f927-4a0c-9d8d-f9804ebbcd74","resolution":{"observed_at":"2026-08-12T19:32:14.306055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.294889Z","title":"Al- varez","venue":null,"work_id":"081213ae-398f-4966-867b-51cfbd5241f2","year":2024},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.115323Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:787f71f3a4c50a4f3d4db20499593cf0c1a8e395ad70a2dad5dfd5d0304beaa7","observation_id":"84e84d35-fa8d-4d45-8867-05d0ccc8cdd7","resolution":{"observed_at":"2026-08-12T19:32:14.297987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.284833Z","title":"DETR3D: 3D Object De- tection from Multi-view Images via 3D-to-2D Queries","venue":null,"work_id":"1bc4533c-ec10-4db2-81f0-b722037bb036","year":2021},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.119389Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:e0a93cabae4ece9f98bc1ac956ecb63311def145a0e64acc43096b790a57f1f7","observation_id":"ea5991d9-253d-4792-80ab-2d8554365293","resolution":{"observed_at":"2026-08-12T19:32:14.288727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.275971Z","title":"PARA-Drive: Parallelized Architecture for Real-time Autonomous Driving","venue":null,"work_id":"2d804cf4-95d8-4fca-b4a6-bb7f4a214937","year":2024},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.122040Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:15b304e23a4c47fb1c78dd3e2d3d43c4f571da563b1b2754ac9d8e4cdbd51a10","observation_id":"8705a9cd-bc7f-47c3-a8d0-5ceeef908dab","resolution":{"observed_at":"2026-08-12T19:32:14.279173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.266556Z","title":"Florence-2: Advancing a Unified Representation for a Va- riety of Vision Tasks","venue":null,"work_id":"5fe8c639-b198-4e48-8960-21583d0db509","year":2024},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.125088Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:427728e619fd2d1f640674f8a542658c66c80bc594c0b4a0049dec44a9ffa77d","observation_id":"241a726d-53bd-4835-8136-612c80934ebe","resolution":{"observed_at":"2026-08-12T19:32:14.270033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.256466Z","title":"CoBEVT: Cooperative Bird’s Eye View Semantic Segmentation with Sparse Transformers","venue":null,"work_id":"f8f20795-830b-40f3-9749-34b96d082b09","year":null},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.128533Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:9a0178f9669a3c0a64963798a2c4811cd465161361e49f9c9e0f5e8561132d29","observation_id":"3a0d6df6-9dba-4884-aed3-352d29e7d410","resolution":{"observed_at":"2026-08-12T19:32:14.260408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.245061Z","title":"Wong, Zhenguo Li, and Hengshuang Zhao","venue":null,"work_id":"3bc92fcf-9849-43c0-828a-87060f281bb7","year":2024},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.133172Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:9c1164122bd9b24247156154352b6f9350542cbedcc11c0d8ba18932429b136e","observation_id":"4d057410-af34-4e9a-b3ee-fa5e618edfa7","resolution":{"observed_at":"2026-08-12T19:32:14.248644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.231597Z","title":"BEVFormer v2: Adapt- ing Modern Image Backbones to Bird’s-Eye-View Recogni- tion via Perspective Supervision","venue":null,"work_id":"f2e160a8-75c9-47f9-8891-499ef59e978a","year":2023},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.136525Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:6d74fc9c06be5f62bf700f6d5c7b3a6566c151ec8a874a3ad1b3a0b4e7ce5acf","observation_id":"4a24f17e-59b8-4e4b-9e27-263125f921d0","resolution":{"observed_at":"2026-08-12T19:32:14.236326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.219779Z","title":"BEVDiffuser: Plug-and-Play Diffusion Model for BEV Denoising with Ground-Truth Guidance","venue":null,"work_id":"84108a22-0940-43a9-84a4-43aa2cc5e132","year":2025},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.140134Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:7187cc67e3267b3b5235d13d704dadab4fecd316a848714af47547314ef0345e","observation_id":"5199b568-f85a-4dc7-a51b-a99d50c2cee9","resolution":{"observed_at":"2026-08-12T19:32:14.223050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.209633Z","title":"Florence: A New Foundation Model for Computer Vision","venue":null,"work_id":"7956798e-808a-4306-88b0-68e124fcb55b","year":2021},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.145025Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:a11e0906c488b86f02b1f898d5aee8817e300332569b9e0156c16deabc9414de","observation_id":"60b98a47-2a22-48fd-8d21-67912726a4f1","resolution":{"observed_at":"2026-08-12T19:32:14.213540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.197414Z","title":"X-Trans2Cap: Cross-Modal Knowledge Transfer using Transformer for 3D Dense Cap- tioning","venue":null,"work_id":"34bbbbb7-8ef1-40bd-99f7-6d41665ecc65","year":2022},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.148248Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:2c67cd7f8ec5a633d0b4ee5abb3bed0bf71446d1953d7f4993972485757f45ec","observation_id":"18ed83e4-f60a-48b2-bcf3-87a291d48b7c","resolution":{"observed_at":"2026-08-12T19:32:14.201308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.187839Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Lan- guage Models with Zero-init Attention","venue":null,"work_id":"9715530f-a7f8-487c-981a-739a283fb0bc","year":2024},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.151394Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:99c06b4ba9498ec34f78e1cd1da7893d7d23ac6bb0d7e5b0fede979363016b67","observation_id":"3a11d807-7e4b-4a57-9013-ed99e39a5933","resolution":{"observed_at":"2026-08-12T19:32:14.191412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:32:14.174548Z","title":"Learning to Prompt for Vision-Language Models","venue":null,"work_id":"4d60cd81-2719-40cc-a357-97b4f087a7fa","year":2022},"citing_paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T19:32:14.153900Z"},"links":{"citing_paper":"/paper/2411.10639"},"observation_digest":"sha256:5a79ba32f22eca2ebe97bee6c5495819b720a42284021c53c1abb463e7e56115","observation_id":"eedb5c2f-ffc9-4c68-846e-8b7d2887aac0","resolution":{"observed_at":"2026-08-12T19:32:14.180712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.10639","last_updated":"2025-03-10T20:59:22Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T19:26:21.473148Z","submitted_at":"2024-11-16T00:14:13Z","title":"MTA: Multimodal Task Alignment for BEV Perception and Captioning"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":46},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 1 inbound Pith citation observation for arXiv:2411.10639."}