{"as_of":"2026-08-16T01:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ac0948d1809e96bd0316bc9ecba2039d3d4bffd807d3669cdfa3350974c1e0aa","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:46:48.174002Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.00785/citation-record","integrity":"/paper/2501.00785/integrity","json":"/paper/2501.00785/citation-record.json","paper":"/paper/2501.00785"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.16019","last_updated":"2024-09-24T12:22:38Z","snapshot_observed_at":"2026-08-15T17:13:44.979697Z","submitted_at":"2024-09-24T12:22:38Z","title":"AIR-Embodied: An Efficient Active 3DGS-based Interaction and Reconstruction Framework with Embodied Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16019","snapshot_observed_at":"2026-08-10T22:46:48.016883Z","title":"Air- embodied: An efficient active 3dgs-based interaction and reconstruc- tion framework with embodied large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.016883Z"},"links":{"cited_paper":"/paper/2409.16019","citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:4e2f5cbdba3a4b4a9679865422968d15f484c0d655dfd0a72e0a5177d4439cf2","observation_id":"9c102ae2-cb8f-43fc-804b-ba2aa2970ba2","resolution":{"observed_at":"2026-08-10T22:46:48.016883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.022958Z","title":"Handle object navi- gation as weighted traveling repairman problem,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.022958Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:4080cb490ad302067c00ab63dce2250e9acf17d66d675459c309040e508fa1c7","observation_id":"dd974f31-2ed6-479d-9729-ff2b7ae379b0","resolution":{"observed_at":"2026-08-10T22:46:48.022958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.816621Z","title":"Medical robots for infectious diseases: Lessons and challenges from the covid-19 pandemic,","venue":null,"work_id":"f83c54bf-0bc6-483e-8409-84e78e6410da","year":2021},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.027125Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:5b0a7d6051d1bbf281353379c75a97629f1773fcc7a140a598f4f3c5a85c7e82","observation_id":"c519d170-b4f1-49b0-9190-a4c6a113043d","resolution":{"observed_at":"2026-08-10T22:46:48.820813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.805095Z","title":"Jacquard v2: Refining datasets using the human in the loop data correction method,","venue":null,"work_id":"b24cc1e4-8959-400b-b885-82279c0f06f8","year":2024},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.031267Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:8cee90b5a5687f5cc8d3af25c3915f485d94c2470133a7b42970fdd3788b0576","observation_id":"d73ef616-d2ec-4549-9168-43690b31b8bb","resolution":{"observed_at":"2026-08-10T22:46:48.808905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.792755Z","title":"Distilling location proposals of unknown objects through gaze information for human- robot interaction,","venue":null,"work_id":"aee96643-a1a5-40bd-b3e8-18d33187ce5a","year":2020},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.034551Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:6af6b51a93eb0723f47aa131598799faa04f09703a7aece29da7b46a2b3a2636","observation_id":"ac94c641-2695-483e-8e0d-4d14e947f2ad","resolution":{"observed_at":"2026-08-10T22:46:48.796571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.780510Z","title":"Communicating human intent to a robotic companion by multi-type gesture sentences,","venue":null,"work_id":"2b5773f4-76a7-422e-850d-afb108c608c7","year":2023},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.038095Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:f1530ce72a2ec472d97ef3cd65f7c8984509ff97fd3902456034f708cc586126","observation_id":"e7c5a1c3-1664-47e4-be48-d2f9356a1b4e","resolution":{"observed_at":"2026-08-10T22:46:48.784543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.769824Z","title":"Analysis of the accuracy and robustness of the leap motion controller,","venue":null,"work_id":"64715b1b-a8af-4db9-8e16-e7be1b5d871d","year":2013},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.041649Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:5b561ec21c38645671d2acecba05e5ef879ff7bfd567f52a1912cf7d143f3c0c","observation_id":"e9e624ed-6994-4805-bf99-645bf470d91f","resolution":{"observed_at":"2026-08-10T22:46:48.773388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.757953Z","title":"Intuitive multi-modal human-robot interaction via posture and voice,","venue":null,"work_id":"bc756b4a-3db8-4c47-961f-ffdb51c94f0f","year":2024},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.044851Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:ca75a6fa72ec020dfce5cda0c159d13a3fc34000d9a00558a7a39a77d98e519d","observation_id":"ac100f03-6a1d-48a4-907e-991b05cc6964","resolution":{"observed_at":"2026-08-10T22:46:48.762140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.048283Z","title":"Large language models for human–robot interaction: A review,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.048283Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:a2002ae30ac4afe93a601d44a537656f13f2e14f1cc7f07639af18cc16e67053","observation_id":"566c6986-1d54-4722-8777-94c24c9f55fc","resolution":{"observed_at":"2026-08-10T22:46:48.048283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.737994Z","title":"Chat with the environment: Interactive multimodal perception using large language models,","venue":null,"work_id":"e4f4c13b-e023-4892-830a-12a6ce3a3ecf","year":2023},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.051507Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:28ff7fba234169cf479627dd2d7c65fe1431add55e290439b1f8ad0a97fe3f3f","observation_id":"60197be4-e353-4d46-b877-6fea7d2438aa","resolution":{"observed_at":"2026-08-10T22:46:48.742470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.726221Z","title":"Generating executable action plans with environmentally-aware language models,","venue":null,"work_id":"595aa5f3-dedd-40f5-bdb4-de44ce6eca02","year":2023},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.054861Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:22e4846b09714c011ce2b64364f792d6c2a6a37bd2b48917c724517fa48d7ab1","observation_id":"40693d29-ab2b-4d89-9fc4-239260494d1f","resolution":{"observed_at":"2026-08-10T22:46:48.730618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.714355Z","title":"A fast and light-weight noniterative visual odometry with rgb-d cameras,","venue":null,"work_id":"cd3e7a8f-6645-4317-8b1c-c2ddb465409f","year":2024},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.058222Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:fcf1fa9cd1bfcb76f9d71933eda25e23c63f97dd42d9837d89f4964bd1068aaf","observation_id":"f182ba0e-2643-4502-8c01-f65cf561e03e","resolution":{"observed_at":"2026-08-10T22:46:48.717891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.703044Z","title":"Sgba: Semantic gaussian mixture model-based lidar bundle adjustment,","venue":null,"work_id":"b028c706-783e-4111-9a4f-a5088c7d65c6","year":2024},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.061147Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:75f87eedf1eed48a3c6902ac1dfbee092e983adca8e7620ee76d3b9b51a5a7a7","observation_id":"7dafc02a-81dd-44bf-b5d0-c74ce750e39f","resolution":{"observed_at":"2026-08-10T22:46:48.706622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.063994Z","title":"Survey on localization systems and algorithms for unmanned systems,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.063994Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:644c1f42c1c20d87c574ac33e7ad6eb5310d05adf2855363b1e4ae6a7a79bdaa","observation_id":"9a3ff5e5-7dec-4726-abce-c25c6f7e6819","resolution":{"observed_at":"2026-08-10T22:46:48.063994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.685348Z","title":"From macro to micro: Autonomous multiscale image fusion for robotic surgery,","venue":null,"work_id":"a4a836f4-3255-40db-a62c-130c0f1804c5","year":2017},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.067463Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:f8e0e6d4b90f73ae87c55eb51f0199f17b37e83c235e908ba756af0dfa3adf48","observation_id":"beaf1644-907d-443d-af39-ddaa9b72bc4e","resolution":{"observed_at":"2026-08-10T22:46:48.688861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.672586Z","title":"A socially assistive robotic platform for upper-limb rehabilitation: A longitudinal study with pediatric patients,","venue":null,"work_id":"d573a364-e49d-438a-a0ca-6be6cab18b0b","year":2019},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.071162Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:0b1c6c2f7c6c6d2c79471279ff445fc2863fac488a397b6aaef30dce59c97bd7","observation_id":"a740985b-9ca9-4d01-ba96-e86057c2f406","resolution":{"observed_at":"2026-08-10T22:46:48.677123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.075381Z","title":"Language-conditioned imitation learning for robot ma- nipulation tasks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.075381Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:fcdde49e6e7ec97ea8ff060ee26bbf2e6b8c3c1fac773345d46c37ddc6bf9a7f","observation_id":"1ed8c4bc-2a1a-4322-820e-3b2084da239d","resolution":{"observed_at":"2026-08-10T22:46:48.075381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.653239Z","title":"Towards real-time physical human-robot interaction using skeleton information and hand gestures,","venue":null,"work_id":"9b955d30-c244-4f09-8669-a7d3b66489df","year":2018},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.078959Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:b27884640976e858c9f6c19adba1a9356eab76a8b5315245eaaff43c1fafab46","observation_id":"bab4ed14-f9aa-4577-bc37-0d6fb5af09dc","resolution":{"observed_at":"2026-08-10T22:46:48.657370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.642575Z","title":"Control system shell of mobile robot with voice recognition module,","venue":null,"work_id":"0ae91210-4aa2-43d8-9332-0aad187e0af5","year":2019},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.082519Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:6d7cbb08c6eaebea97d829832989a67d3c9d0d607f22ac5af2bea42ad695d7ae","observation_id":"ebe3fc61-68c9-4ead-b8ad-90530eda6a65","resolution":{"observed_at":"2026-08-10T22:46:48.646365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.630201Z","title":"Armar-6: A high- performance humanoid for human-robot collaboration in real-world scenarios,","venue":null,"work_id":"7f0c6423-eb66-4653-b6b1-fa5c2b49f9c1","year":2019},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.085860Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:b1f5c2a7b23cac23140b985fe2f9dee7c70017217446a26c3d36b4b2b189d06b","observation_id":"b8d038e5-ee87-4e6f-b8f4-1261bc9cd8fd","resolution":{"observed_at":"2026-08-10T22:46:48.633964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.619493Z","title":"Unsupervised scene categorization, path segmentation and landmark extraction while traveling path,","venue":null,"work_id":"315d7b15-40f8-4475-9541-3ea71d4b9caa","year":2020},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.089379Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:655477dbaa111f5929ecd3c6229b3d66731a22c32ee50866bcc1f55f3f4cce8c","observation_id":"830ec27d-e4ff-4711-8565-8e5f0262f477","resolution":{"observed_at":"2026-08-10T22:46:48.623021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.607919Z","title":"Working with walt: How a cobot was developed and inserted on an auto assembly line,","venue":null,"work_id":"ccbef0f9-dc15-4a99-8626-dacd684322b2","year":2018},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.093012Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:69966cc2044880d3e7490349814e7e39a5afe9faf76d47528402d525ae73c732","observation_id":"7bbf63b1-daa9-42a8-883c-b3998b2198e3","resolution":{"observed_at":"2026-08-10T22:46:48.611520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.596669Z","title":"A tool for organizing key characteristics of virtual, augmented, and mixed reality for human–robot interaction systems: Synthesizing vam- hri trends and takeaways,","venue":null,"work_id":"2ee675dc-c1f3-4a09-97d0-e3bd8c4c9733","year":2022},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.096663Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:97c14b8275b698e9ce5de1723d1e0dc02f056dd5e0264707a4283961717bd942","observation_id":"ef210d54-5d3a-4b27-ae81-fd551cd3d258","resolution":{"observed_at":"2026-08-10T22:46:48.600536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.585413Z","title":"An extensible architecture for robust multimodal human-robot communication,","venue":null,"work_id":"b62d1e28-201d-40f9-a666-bbc5068fffa4","year":2013},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.100788Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:93b016f6a93d5a16b0ec253f14397999c27efa2d7e09fec642b70d02f02e18af","observation_id":"7fd0aa70-2306-4bf0-99fa-d338b8bfbdf6","resolution":{"observed_at":"2026-08-10T22:46:48.589005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.573898Z","title":"Intelligent robotic wheelchair with emg-, gesture-, and voice-based interfaces,","venue":null,"work_id":"f90d0639-4d99-43a3-b687-cb390961fbfc","year":2003},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.104660Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:93c40ff4f483145624c26c3765848a5617c2ee5087d52b80472c56c463d4ce86","observation_id":"dc39ffb9-52cc-49e9-b333-9f1fcc6cc54f","resolution":{"observed_at":"2026-08-10T22:46:48.578089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.561494Z","title":"Interactive multimodal robot dialog using pointing gesture recogni- tion,","venue":null,"work_id":"352c4e00-9d0f-4017-83de-9b1b37c9da8f","year":2022},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.108869Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:df0c9b961fa1799f34fd2556b0752ebd0585474e409c18877323dd4509da862d","observation_id":"506d7710-ac07-4fed-b45f-c6d290d5878b","resolution":{"observed_at":"2026-08-10T22:46:48.566054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.550409Z","title":"Adaptive-lio: Enhancing robustness and precision through environmental adaptation in lidar inertial odometry,","venue":null,"work_id":"354eace6-0e49-4c74-a41c-a78643c1907f","year":2024},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.112446Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:dd2f14cd8797aa12ba04bcf28e25cb97c88e1afd4429600ab6c4ac6b3e47c95a","observation_id":"8e4f1339-1480-4818-b233-d86617383a01","resolution":{"observed_at":"2026-08-10T22:46:48.554230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.538755Z","title":"Robust loop closure by textual cues in challenging environments,","venue":null,"work_id":"7dea27b1-4cc9-4ba9-be41-8b180e11e0d0","year":2025},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.116160Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:0dd205ee4f401bae3718ddfbdaa1428c981bd04a23489a3f16bb93aaeb248dcb","observation_id":"b9519a43-7540-454c-9f52-40a63baba78f","resolution":{"observed_at":"2026-08-10T22:46:48.542463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.527936Z","title":"Chatgpt for robotics: Design principles and model abilities,","venue":null,"work_id":"b94f52a7-26a5-43d5-b1be-e7dccd3b16f3","year":2023},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.120390Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:07dbd9428ae11bda4e7be6445d5b9e78a7b1c1441681ee93b6078ab773686874","observation_id":"59309e38-4b27-496e-ab92-fed2f2c928d0","resolution":{"observed_at":"2026-08-10T22:46:48.531417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.517566Z","title":"Ua-mpc: Uncertainty-aware model predictive control for motorized lidar odom- etry,","venue":null,"work_id":"87449d59-0b0c-4ded-8eb2-69329b7a8ebb","year":2025},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.124279Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:95b3b2134addc14e87debf49bcddadbb6247a07403c15d63f72537dff0c52c66","observation_id":"12d6069f-0c8f-4006-acfc-02326656b876","resolution":{"observed_at":"2026-08-10T22:46:48.520688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.127536Z","title":"Unsupervised uav 3d trajectories estimation with sparse point clouds,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.127536Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:eba1f4a335431199de43906c256aed501023070806931cb71954d1a8d6af2c8e","observation_id":"999f7006-3bb3-49ae-8cf3-fca1336b6236","resolution":{"observed_at":"2026-08-10T22:46:48.127536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.498232Z","title":"Language mod- els are few-shot learners,","venue":null,"work_id":"7aea409f-be1b-46aa-8980-68e8ee18a29e","year":1901},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.130980Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:a522ae77e420fab6ed2f8477691be999a50d3e69c6d22cbfa720afa50183e088","observation_id":"a5a48dfe-f9fb-4165-8d95-c5f967616be6","resolution":{"observed_at":"2026-08-10T22:46:48.502949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.485921Z","title":"Evaluation of the efficiency of state-of-the-art speech recognition engines,","venue":null,"work_id":"5e255b1f-3c15-4354-8820-009b5e4b37d0","year":2022},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.133861Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:00fc055a587b1dbdd055ce3c24e7be508fdd3c6d775ed43c83199d19450a351a","observation_id":"27dfbcdd-c85e-432c-8bf1-f87a340a9552","resolution":{"observed_at":"2026-08-10T22:46:48.490155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.474198Z","title":"Hand and arm gesture- based human-robot interaction: A review,","venue":null,"work_id":"c4c96e51-dde3-4877-865e-0449731c53ac","year":2022},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.136524Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:232b56256a622d93de3458f5946b4aac89f5b7af76114542a1f7ece6402d0943","observation_id":"62fc647c-412b-433d-ab61-4ba302fde950","resolution":{"observed_at":"2026-08-10T22:46:48.478557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.139938Z","title":"You only look once: Unified, real-time object detection,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.139938Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:41e184df19f05dccfdd8173792b8b21d6d8845ccc6f87e48b84e2874b6d9cf9f","observation_id":"89c588d9-2eeb-4f4f-9021-56dddfcec6ab","resolution":{"observed_at":"2026-08-10T22:46:48.139938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.143612Z","title":"Yolo-world: Real-time open-vocabulary object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.143612Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:762f668da41e7f0ffaf599e7f1aa51cf94d95f64b920d45879afa70555fa34c4","observation_id":"9af4ce04-1d1c-4686-94ef-3446478ef5e8","resolution":{"observed_at":"2026-08-10T22:46:48.143612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.147126Z","title":"Realtime multi-person 2d pose estimation using part affinity fields,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.147126Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:2905a198f3b80936e0c4d73f4b914f2cacb08a678b0bed18caf0537d3059697f","observation_id":"0f1214f0-2c30-442f-9ecb-8c06d34f8d10","resolution":{"observed_at":"2026-08-10T22:46:48.147126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.442571Z","title":"Autonomous object level segmentation,","venue":null,"work_id":"ebfac116-7700-4212-8f3c-7729c69437b9","year":2014},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.150681Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:38772baef797e0e74eea90cf8941a7fffa4fc37966d6ea2f8fe82b7e7139349c","observation_id":"1bc1d1a8-ae67-495f-8e36-60dfda88a907","resolution":{"observed_at":"2026-08-10T22:46:48.446082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.431914Z","title":"Airslam: An efficient and illumination-robust point-line visual slam system,","venue":null,"work_id":"812f713d-47b0-4d8f-a3e8-13a5b4557b65","year":2025},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.154360Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:5954757aad54fccd5c54591b573a1046d6e5f7f944e5ef0d962d12e80ff4a03b","observation_id":"7f1ea820-4f0b-4681-a6fd-d64853af6beb","resolution":{"observed_at":"2026-08-10T22:46:48.435205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.419351Z","title":"Relative localiz- ability and localization for multi-robot systems,","venue":null,"work_id":"d7ff06b5-2c50-4839-a8b8-e4394a0b1dc2","year":2025},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.157726Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:3944373a31a0c9bc68ec28433a60616effaa91d677ab3ff4969ea254a1b668ce","observation_id":"5843b6df-3874-4cbc-9347-939a582f0609","resolution":{"observed_at":"2026-08-10T22:46:48.424521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.407600Z","title":"Large-scale uwb anchor calibration and one- shot localization using gaussian process,","venue":null,"work_id":"5c0bfa8e-451a-4cd3-a6da-95ecf329bb32","year":2025},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.160837Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:189bd4330bd894206368db42337cd55ef3ab1a9775fc97ce4291359ea91cdf73","observation_id":"78aa660b-3d34-4589-ac4c-b457ab40a28a","resolution":{"observed_at":"2026-08-10T22:46:48.411778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.395359Z","title":"Helmetposer: A helmet-mounted imu dataset for data-driven estimation of human head motion in diverse conditions,","venue":null,"work_id":"a1a2fb98-519d-4b65-8bb9-6b40f80d4bd6","year":2025},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.164396Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:ad2c9de91dbbf00f09222e902075f5539f6fdac5208be786786d31155b3860e6","observation_id":"751fcb3f-b8d1-4bc2-889a-297889d6f896","resolution":{"observed_at":"2026-08-10T22:46:48.399328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.381109Z","title":"Heterogeneous stereo: A human vision inspired method for general robotics sensing,","venue":null,"work_id":"f4092e75-9ba3-42d0-a85d-c8af9bcc3fa1","year":2017},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.167797Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:b00ef7cad839e360b2e008302748ee3e9a56ad53c864e8eb71bdc189db160ccc","observation_id":"2c7b8bef-9bc3-4607-a15a-2f7d666c6e99","resolution":{"observed_at":"2026-08-10T22:46:48.386740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:48.170804Z","title":"Nvp-hri: Zero shot natural voice and posture-based human–robot interaction via large language model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.170804Z"},"links":{"citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:8091fbfc206bc922bc7cd4f62df874496ea0411725204a191940af87ddcc8c4d","observation_id":"444ebb34-c38f-4a7d-9203-86e37f408d9a","resolution":{"observed_at":"2026-08-10T22:46:48.170804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16492","snapshot_observed_at":"2026-08-10T22:46:48.174002Z","title":"Fam- hri: Foundation-model assisted multi-modal human-robot interaction combining gaze and speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.174002Z"},"links":{"cited_paper":"/paper/2503.16492","citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:b3326c8dea9dd07dcf84a6d807bb74bf28688188fb52e59176e5a9fe9450cb5c","observation_id":"829ca9da-7935-4272-bb01-b912871b234b","resolution":{"observed_at":"2026-08-10T22:46:48.174002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","latest_version":3,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2501.00785."}