{"as_of":"2026-08-15T23:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:13005579b5cc91ff9cc62e722bbc7516bf6a1764a956d7c66081d50c412c8293","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-23T01:10:55.850274Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:46:48.174002Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T04:57:38.604855Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16492","snapshot_observed_at":"2026-08-10T22:46:48.174002Z","title":"Fam- hri: Foundation-model assisted multi-modal human-robot interaction combining gaze and speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.00785","last_updated":"2025-04-04T06:14:36Z","snapshot_observed_at":"2026-08-15T22:59:00.718067Z","submitted_at":"2025-01-01T09:48:16Z","title":"Natural Multimodal Fusion-Based Human-Robot Interaction: Application With Voice and Deictic Posture via Large Language Model","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:48.174002Z"},"links":{"cited_paper":"/paper/2503.16492","citing_paper":"/paper/2501.00785"},"observation_digest":"sha256:b3326c8dea9dd07dcf84a6d807bb74bf28688188fb52e59176e5a9fe9450cb5c","observation_id":"829ca9da-7935-4272-bb01-b912871b234b","resolution":{"observed_at":"2026-08-10T22:46:48.174002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16492","snapshot_observed_at":"2026-08-06T15:31:10.299425Z","title":"Fam- hri: Foundation-model assisted multi-modal human-robot interaction combining gaze and speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15729","last_updated":"2025-07-21T15:38:25Z","snapshot_observed_at":"2026-08-14T14:21:12.316753Z","submitted_at":"2025-07-21T15:38:25Z","title":"Gaze-supported Large Language Model Framework for Bi-directional Human-Robot Interaction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:10.299425Z"},"links":{"cited_paper":"/paper/2503.16492","citing_paper":"/paper/2507.15729"},"observation_digest":"sha256:87a4da4c16dcf436b8d6ef7ea3a65cec1f9d7a7c68c5969caaf267e658597c4f","observation_id":"fb998fb0-166b-48cd-a1b3-444875bef31d","resolution":{"observed_at":"2026-08-06T15:31:10.299425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16492","snapshot_observed_at":"2026-08-04T19:39:07.075356Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09154","last_updated":"2025-09-11T05:23:22Z","snapshot_observed_at":"2026-08-06T15:36:44.934159Z","submitted_at":"2025-09-11T05:23:22Z","title":"Mind Meets Space: Rethinking Agentic Spatial Intelligence from a Neuroscience-inspired Perspective","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-08-04T19:39:07.075356Z"},"links":{"cited_paper":"/paper/2503.16492","citing_paper":"/paper/2509.09154"},"observation_digest":"sha256:507a049d558ab7bae5ada478c1c9ab14d8d4631acaa6309d19c5a9e71e2e0df9","observation_id":"f9ad8420-686a-4da6-9528-a95aa196d81e","resolution":{"observed_at":"2026-08-04T19:39:07.075356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"cited_work":{"arxiv_id":"2503.16492","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.16492","snapshot_observed_at":"2026-07-03T04:57:38.604855Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","venue":"cs.HC","work_id":"6180d42c-0030-47ff-bae1-62818e8d69d6","year":2025},"citing_paper":{"arxiv_id":"2512.10719","last_updated":"2026-07-12T18:02:23Z","snapshot_observed_at":"2026-08-13T00:17:23.466368Z","submitted_at":"2025-12-11T14:59:07Z","title":"SpaceDrive: Infusing Spatial Awareness into VLM-based Autonomous Driving","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T12:17:54.325055Z"},"links":{"cited_paper":"/paper/2503.16492","citing_paper":"/paper/2512.10719"},"observation_digest":"sha256:870c1ed2f4016db7e3f289bd9a8493370d8e6b339ee0ba4434ff14652b4b5dae","observation_id":"b9f2c4a1-f946-4ca1-afb4-b51790544ce6","resolution":{"observed_at":"2026-05-22T12:21:31.264373Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16492","snapshot_observed_at":"2026-08-03T17:07:42.809307Z","title":"Fam- hri: Foundation-model assisted multi-modal human-robot interaction combining gaze and speech.arXiv preprint arXiv:2503.16492, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10719","last_updated":"2026-07-12T18:02:23Z","snapshot_observed_at":"2026-08-13T00:17:23.466368Z","submitted_at":"2025-12-11T14:59:07Z","title":"SpaceDrive: Infusing Spatial Awareness into VLM-based Autonomous Driving","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T17:07:42.809307Z"},"links":{"cited_paper":"/paper/2503.16492","citing_paper":"/paper/2512.10719"},"observation_digest":"sha256:20e2d8f9819dad4867727ab8c1f3d4d3cdf3576c18d2ce86882b3a48f64b1b55","observation_id":"0601019d-8154-4643-a96d-f50bc647a580","resolution":{"observed_at":"2026-08-03T17:07:42.809307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"cited_work":{"arxiv_id":"2503.16492","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.16492","snapshot_observed_at":"2026-07-03T04:57:38.604855Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","venue":"cs.HC","work_id":"6180d42c-0030-47ff-bae1-62818e8d69d6","year":2025},"citing_paper":{"arxiv_id":"2606.10276","last_updated":"2026-06-09T00:50:29Z","snapshot_observed_at":"2026-08-15T17:22:27.752672Z","submitted_at":"2026-06-09T00:50:29Z","title":"Hierarchical Policies from Verbal and Egocentric Human Signals for Natural Human-Robot Interaction","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T13:31:02.640975Z"},"links":{"cited_paper":"/paper/2503.16492","citing_paper":"/paper/2606.10276"},"observation_digest":"sha256:7e6d19cfee0147813f95fd6febd012cf18551f5554f103c828eb5255272b2180","observation_id":"8c624a78-df58-47cc-82e1-a232ae2d3f6a","resolution":{"observed_at":"2026-07-03T04:57:38.606095Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2503.16492/citation-record","integrity":"/paper/2503.16492/integrity","json":"/paper/2503.16492/citation-record.json","paper":"/paper/2503.16492"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Social robots in therapy and care","venue":null,"work_id":"f7be2be7-d371-4616-9f89-2641fb423ef9","year":2019},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:e18e7b4852f5f68afee66edbdf8117c58376cb62910404b521519fef0fb1a5b2","observation_id":"a90f630d-ffd0-4942-a234-0f17297e9db1","resolution":{"observed_at":"2026-05-23T01:15:18.498346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jubileo: An open- source robot and framework for research in human-robot social interac- tion","venue":null,"work_id":"b4673caf-862d-4ef9-9758-67f9a4013053","year":2022},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:ed3e0bee488497c873d5bcc20f1dacf502cdb699a6cfa2a625231f4fc575216b","observation_id":"2c5c96ee-84a7-45b9-b6a9-82fa5872d50b","resolution":{"observed_at":"2026-05-23T01:12:22.128820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human-aware physical human–robot collaborative transportation and manipulation with multiple aerial robots","venue":null,"work_id":"d305107e-3430-4bd7-9c13-11be21669cd2","year":2025},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:85fd417d3b4f8aec8492a7cc1440c91e5b8db3847ae0de303e8ab11d564f8bca","observation_id":"f34bb0eb-1fa4-4202-b70c-34b47f84741b","resolution":{"observed_at":"2026-05-23T01:12:22.119264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Communicating human intent to a robotic companion by multi-type gesture sentences","venue":null,"work_id":"3b305cae-7d22-44ef-9616-44100381f57f","year":2023},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:7b12b711ee44b28faf51433ff50a9edec1f012e817352dfc67190e74b6d20842","observation_id":"d98a3c25-71e5-4f90-b9c5-728f256fc094","resolution":{"observed_at":"2026-05-23T01:12:22.134707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nvp-hri: Zero shot natural voice and posture-based human–robot interaction via large language model","venue":null,"work_id":"e589db0a-1e6a-4ac4-a6d9-54e153115d95","year":2025},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:55b636c038190d246e1473d3440b76e592211fc1bcc84befe7c90a82b7f460a9","observation_id":"5b6af122-e4a8-40b3-a9be-a587238033ad","resolution":{"observed_at":"2026-05-23T01:12:22.122045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robot reading human gaze: Why eye tracking is better than head tracking for human-robot col- laboration","venue":null,"work_id":"a840e97f-993d-4c18-a299-8de05f0c63d0","year":2016},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:36c9e53024b295f180eaa156ae10dde0dc61c4795a6d966624017cfefa4ca47e","observation_id":"e82bc16b-485c-4eec-99fc-960afc86de6d","resolution":{"observed_at":"2026-05-23T01:12:22.125007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A gaze-speech system in mixed reality for human-robot interaction","venue":null,"work_id":"7ecd1a6f-8d79-4d93-adc7-4ad69d16404f","year":2023},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:db9f46fccf9244d17a29ee18a68531f6b9f15b7a0984f016393beb7ca42717e0","observation_id":"8b016c46-0c14-406b-9e6a-28c479563a7d","resolution":{"observed_at":"2026-05-23T01:12:22.115991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human–robot interaction through eye tracking for artistic drawing","venue":null,"work_id":"40b7ccb2-8a8b-460e-8911-8981b07bb0ec","year":2021},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:264e7552deb621e42ad3cec2ef3fce272620567d26e29eda751db3d6d9ddfcd4","observation_id":"de8dca7e-1ef4-48da-8c8b-9c8aebb24d00","resolution":{"observed_at":"2026-05-23T01:12:22.110198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Is it possible to recognize a speaker without listening? unraveling conversation dynamics in multi-party interactions using continuous eye gaze","venue":null,"work_id":"5c46bab4-3bb4-4ae2-8c23-9acec9c976c4","year":2024},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:69ce581be6db627ee1a4fd87b9f094724cc310b843146b0a4623ff2751bfd486","observation_id":"5c486e0b-366d-4f44-8c52-95c382ebf73b","resolution":{"observed_at":"2026-05-23T01:15:18.501692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eye-gaze control of a wheelchair mounted 6dof assistive robot for activities of daily living","venue":null,"work_id":"639eb1e9-5af3-4213-9ac5-b972eac061ea","year":2021},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:ccc3971faaae0e98f6e46f2ffba42fc041e8d47924de199423c1489838275178","observation_id":"8466c8fb-5ca1-4abc-a755-aedd77d4e226","resolution":{"observed_at":"2026-05-23T01:12:22.137422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Free-view, 3d gaze-guided, assistive robotic system for activities of daily living","venue":null,"work_id":"2f3b8bf0-b55d-43a3-8aca-dff0cbe70875","year":2018},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:d9f7b6488601550db3fb9235aad47150fcbf92baf595d9ac187b92012c22f01d","observation_id":"935e96a0-07e1-43b4-abba-59deb811e27b","resolution":{"observed_at":"2026-05-23T01:12:22.132103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Microsaccade-inspired event camera for robotics","venue":null,"work_id":"d1cee447-65d6-4cb8-b74c-12d2c1ef4bde","year":2024},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:4b6ceecc7276a0d0336288dbf7341135c462bdb76b98ebd6ad31a8c2ed0f320b","observation_id":"2ec08df2-47da-4ebf-b7ba-6311edd74354","resolution":{"observed_at":"2026-05-23T01:12:22.113054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13561","last_updated":"2023-10-01T20:16:22Z","snapshot_observed_at":"2026-08-13T14:52:21.014234Z","submitted_at":"2023-08-24T20:42:21Z","title":"Project Aria: A New Tool for Egocentric Multi-Modal AI Research","version":3},"cited_work":{"arxiv_id":"2308.13561","doi":"10.48550/arxiv.2308.13561","metadata_source":"pith","pith_arxiv_id":"2308.13561","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Project Aria: A New Tool for Egocentric Multi-Modal AI Research","venue":"cs.HC","work_id":"31d9f2a7-f783-4294-9a2c-0a033b2b15fa","year":2023},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"cited_paper":"/paper/2308.13561","citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:fe1c80fd285049aecca25363a9c24be1d2f1850520a0f9cc2c031329b51c979d","observation_id":"84a328ec-92e3-407c-bad0-6116ac31cee4","resolution":{"observed_at":"2026-05-23T01:12:20.528544Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust gaze- based intention prediction for real-world scenarios","venue":null,"work_id":"e5e4d0b6-edcd-44a0-8218-8922135d8076","year":2024},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:16cbc46cece91f449cf4a56ca1b17668ed70099f2bb812d3bde406ac5f60b6c7","observation_id":"9599ee3f-bdf7-433d-b998-3f8e424e18fd","resolution":{"observed_at":"2026-05-23T01:15:18.620189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Getting to know your robot customers: Automated analysis of user identity and demographics for robots in the wild","venue":null,"work_id":"875ea438-e654-4472-8a2c-0e99eb9febb3","year":2018},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:c1928441f18949633334a744ce1c090c4a6d0757b4ea54fc832402ccbb3a1b79","observation_id":"ea247167-bc67-49e9-afed-9df33b676395","resolution":{"observed_at":"2026-05-23T01:15:18.617076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A personalized comfort space with variable shape based on environmental information for robot navigation in homes","venue":null,"work_id":"e2c0e3fe-615a-4169-94e9-ada02966589b","year":2025},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:80faed61da239213a166e9e34e5880f7ef48c26933c4aeb6405ed32c74f007d5","observation_id":"910f1d15-3185-4d1a-b07e-28c592d36a60","resolution":{"observed_at":"2026-05-23T01:15:18.613531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving the collision tolerance of high-speed industrial robots via impact-aware path planning and series clutched actuation","venue":null,"work_id":"90cea824-1c60-4857-9a44-973725aa8bfb","year":2024},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:f52f82abdcb160ae28c2b1d994d5c5285c73ce522d6b87a69c27dff845ecba06","observation_id":"afe87ad1-6531-44e1-a26d-41153c03a66c","resolution":{"observed_at":"2026-05-23T01:15:18.610101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In situ calibration of six- axis force–torque sensors for industrial robots with tilting base","venue":null,"work_id":"e1f297d0-0198-4be4-8f4e-b8738e29ace1","year":2022},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:61e99eac2bd0e3e419f12f6a6c7a5df1f7d1a4d091dce7aea51c3db96c209a17","observation_id":"a57f45cf-4fa9-494c-8990-9392a22f9248","resolution":{"observed_at":"2026-05-23T01:15:18.606522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gesture-informed robot assistance via foundation models","venue":null,"work_id":"c3e72044-fe6d-4951-9f04-a996e0848b36","year":2023},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:c3643b86370a12f35b1ecf878fd33c5576f4d871695bbd7ad960bc3c4bc620e8","observation_id":"e243694a-600a-4025-af69-5088701a14c1","resolution":{"observed_at":"2026-05-23T01:15:18.603049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interactive multimodal robot dialog using pointing gesture recognition","venue":null,"work_id":"6aafe4b6-b791-4d81-8268-9f84062bddd7","year":2022},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:409839da4f5885fcc371ea88f9c28b70a8ed08b9752e01db7e44009ecfbfb61f","observation_id":"940510b7-d6c0-4d94-92e9-14a5af3548a0","resolution":{"observed_at":"2026-05-23T01:15:18.599715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Code as policies: Language model programs for embodied control","venue":null,"work_id":"02bd6581-5303-4fb1-9f7c-c3b072574f13","year":2023},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:7c14712e2031f6bbc6476be5488492c68937213225e1e0ad81ca442439ff39f2","observation_id":"496eb716-9ef3-4144-b255-ac71be72844e","resolution":{"observed_at":"2026-05-23T01:15:18.596254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Progprompt: Generating situated robot task plans using large language models","venue":null,"work_id":"eda74972-8555-4752-b8e8-b2c46ae56744","year":2023},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:7f10a52d8cca232f631092d5b6fcba57d49682bc58e7ded1ed35fa4e72c59731","observation_id":"0b0e1534-af26-4086-bd52-341690d9cfd4","resolution":{"observed_at":"2026-05-23T01:15:18.592956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semi-autonomous robotic arm reaching with hybrid gaze–brain machine interface","venue":null,"work_id":"a95306b7-a329-4a4b-94e1-f384ec0e5fb5","year":2020},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:8e4dd8be5e3730d044872ca2b2aeca061abc7e57bb8473e6e6ed5b306c27aef0","observation_id":"de495b96-5a16-4344-bf7c-f97d58b016be","resolution":{"observed_at":"2026-05-23T01:15:18.589241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Investigating the usability of collabo- rative robot control through hands-free operation using eye gaze and augmented reality","venue":null,"work_id":"b715b1db-89f6-4192-ae1d-c99047a75113","year":2023},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:3d9df48f29747674f382174add8a8ccf37dafdceada1b8aea30c1c7605d7b25f","observation_id":"0c579db8-c1f5-44ad-abe7-36cdd32dcd11","resolution":{"observed_at":"2026-05-23T01:15:18.585779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human gaze following for human-robot interaction","venue":null,"work_id":"d4ae3625-10c9-4bf4-b103-62deacfe9b97","year":2018},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:41b35d5aa59418d1c3ea12812b30a5425f0b3f7cdc3161e2314914609044919d","observation_id":"c424de04-57ed-4f11-bde6-5bdfb2588bf8","resolution":{"observed_at":"2026-05-23T01:15:18.582187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gaze-based attention recognition for human-robot collaboration","venue":null,"work_id":"43337829-35c1-4887-b007-23ab3fffcb0a","year":2023},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:0f2a6ab6e82d12b65786af0e04780434bad59f93b54665df95dda1dffa0bcff6","observation_id":"f52a08cc-f2d2-4f1a-9642-e0fb93061f79","resolution":{"observed_at":"2026-05-23T01:15:18.578972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A novel human-in-the-loop multimodal intention fusion method for human-robot interaction","venue":null,"work_id":"f477eeb1-6020-4b78-9715-0299a6067eff","year":2025},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:ceb2e6bb67fcb64806b202000f1d081f53da8dd173c1d3e3a2335aafec86e963","observation_id":"5751a08f-385d-46d0-b29c-f6e50498ead3","resolution":{"observed_at":"2026-05-23T01:15:18.575616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alchemist: Llm-aided end-user development of robot applications","venue":null,"work_id":"4612c393-c03c-45a9-9f80-593c34724a0a","year":2024},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:9013c4225ffa6d561cc8d302510aba45b6356ee6e1b0f2de835cb08985839e46","observation_id":"8578005a-437a-419a-96ab-d558537fcaee","resolution":{"observed_at":"2026-05-23T01:15:18.572180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lami: Large language models for multi-modal human-robot interaction","venue":null,"work_id":"c1c3a2c4-3926-4024-82d8-119719f3ca67","year":2024},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:f122b45b86fef7fdabbbd9b34fd7d9e4b4a4f5cba2c00f8bc24b6ae10b8586a0","observation_id":"ecbd186f-2683-4c15-8ba5-4f0afafe9617","resolution":{"observed_at":"2026-05-23T01:15:18.568621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust speech recognition via large-scale weak supervi- sion","venue":null,"work_id":"73a99f0d-1a81-4841-9d1b-a5916956f678","year":2023},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:73da487f2f69bc2f3a0cec5d00b5f1ca7953dbc8149130b0112e76769ac91714","observation_id":"bb177b39-f85f-4513-92e2-f0658bc631a8","resolution":{"observed_at":"2026-05-23T01:15:18.565092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounding DINO: marrying DINO with grounded pre-training for open-set object detection","venue":null,"work_id":"9883523b-510a-48aa-bfff-e539cc79b535","year":2024},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:9ceed6ce726584a4b838d7e860fb51e74c063dfa7b84916c6e309a9bb31578fb","observation_id":"a72528e2-30a4-4431-aa57-a0b3192fc074","resolution":{"observed_at":"2026-05-23T01:15:18.561791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":"b2000cd3-7171-4337-8988-dc0e8aef4d48","year":2025},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:5c47c608b8a3b5cee052f1d97b983cc7f89891edb1a9360f03075569c9bf7023","observation_id":"ce1f1fe4-5005-4905-ad46-a85942036ea9","resolution":{"observed_at":"2026-05-23T01:15:18.558174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ORB-SLAM3: An accurate open-source library for visual, visual-inertial and multi-map SLAM","venue":null,"work_id":"65b8eede-23cc-423f-afdb-0b9aeaed30fa","year":2021},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:7e34693d228e8f0a9252a90840a58a8155dca4fa969975e51427fab30be4fa09","observation_id":"9fda874c-469f-4bb3-a6f7-507ac3e52dcc","resolution":{"observed_at":"2026-05-23T01:15:18.554943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Super- glue: Learning feature matching with graph neural networks","venue":null,"work_id":"5e8fb0d2-05fc-450a-80aa-dab89e3093fc","year":2020},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:843871d4aee1f5bd21abc5a182f4be85f144c848c0e4bf2ae5cdd1e4816edddd","observation_id":"2c5ad54f-e294-4151-b0f0-2c4d1dcff7a8","resolution":{"observed_at":"2026-05-23T01:15:18.551583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Design and implementation of a haptic measurement glove to create realistic human-telerobot interactions","venue":null,"work_id":"1356cb41-5223-4c19-95c1-a94f70f92492","year":2020},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:4f379b49569824328dba5329e498bae69e56488f96430d3d1c285a5a4a12b243","observation_id":"1f99c207-0fb2-4a07-bf49-3715be11343f","resolution":{"observed_at":"2026-05-23T01:15:18.548125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Don’t yell at your robot: Physical correction as the collaborative interface for language model powered robots","venue":null,"work_id":"55d81420-9c85-4902-b630-7f7c54c43044","year":2024},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:d986ba18e981240135390a645c48f935a0a364d01484fca7914ba57801f433b1","observation_id":"7b540175-6910-4a4e-a4f2-d200020897b2","resolution":{"observed_at":"2026-05-23T01:15:18.544376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"7accc5c8-5053-4738-98fb-290e27ac8f2b","year":2022},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:20a082ef331774fd9b5499435f9162d60bf5e701ed98db1d50dd1cfccc80830c","observation_id":"178de768-70af-43cc-90b0-4aaf91676fdc","resolution":{"observed_at":"2026-05-23T01:15:18.540619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Model compression","venue":null,"work_id":"752e116b-35eb-4bde-9ae4-02621edbb895","year":2006},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:77dc1adb2e8cf01c46b6a28e7d317a723e6a68f77c11315a0732e5b00dca3756","observation_id":"acb66482-e5a4-4b3c-9f17-d229533c0146","resolution":{"observed_at":"2026-05-23T01:15:18.537242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Retrieval- augmented generation for knowledge-intensive nlp tasks","venue":null,"work_id":"6c43612d-ac24-4cef-b7fa-71194134142f","year":2020},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:ae539730e49755bad52a229e9c8e9db6f1b34f14cf9176f8860879748dc1076e","observation_id":"814818ae-8916-4fba-aca1-5f51523fa296","resolution":{"observed_at":"2026-05-23T01:15:18.534150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human gaze improves vision transformers by token masking","venue":null,"work_id":"b0ee847b-ef1f-4f41-836d-20d2d463aec9","year":2025},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:165a3893dc53bf4cc98fa7ba5588d4a8ac19ca58adb66bcaf832aa9a89dfc3d7","observation_id":"b1c3cf0a-1399-45fd-85ed-783303144749","resolution":{"observed_at":"2026-05-23T01:15:18.530595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Egolife: Towards egocentric life assistant","venue":null,"work_id":"dee581df-62af-40a9-8f05-cbd8616c8a25","year":2025},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:a29c4ada3acd725089857da11e396415c8bba40edff8db5538a721d338e69a3a","observation_id":"c56d6b22-0910-4d2f-940e-506fbbffe23a","resolution":{"observed_at":"2026-05-23T01:15:18.527137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-25075-0","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interactive multimodal robot dialog using pointing gesture recognition","venue":"Lecture notes in computer science","work_id":"c28ff671-2991-4886-9cdd-3aedb402bd7a","year":2022},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:40859cfbc8823c8b02fc8289eef04210e0ae0a6b46b95f9229086af4634aca32","observation_id":"a4db9305-d286-4410-9fa0-ff7150e5c81d","resolution":{"observed_at":"2026-05-23T01:12:19.807631Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The speech recognition error in our system primarily due to misinterpretation of similar-sounding words","venue":null,"work_id":"aedffa87-f795-4338-8efa-e94c04679df9","year":null},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:ab9ebd3d0fadeaa389ebc6e73cd20a81432c67935f38ddceec12e65fcf337df9","observation_id":"539233a1-3390-4a59-a9d1-24b70220ad98","resolution":{"observed_at":"2026-05-23T01:15:18.523573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"369efb53-32eb-405a-9887-a1104ce6b3e3","year":null},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:fe2f493599a2c73d90e735180cfd27bcf77c13ddc26a22204d41370e026b7c48","observation_id":"1bf8564e-aeb3-4089-85b9-e3865399e044","resolution":{"observed_at":"2026-05-23T01:15:18.519970Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fea- ture matching using superglue becomes unreliable in the presence of weak object textures, repetitive patterns, or partial occlusions, leading to incorrect correspondences","venue":null,"work_id":"798b2028-8a90-4c3f-bd27-9ad3f693a0d7","year":null},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:24f6b106edde7db3062b9109178953b10b237088bcea5acba5e4617da9750a22","observation_id":"eff27f64-7fbf-4972-a976-62c64a22edbc","resolution":{"observed_at":"2026-05-23T01:15:18.516832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Since FAM-HRI requires the LLM’s response to strictly follow a prede- fined prompt format, any deviation renders the output unusable by subsequent system modules","venue":null,"work_id":"887b70fb-0693-42d3-aa55-be9c72c7228d","year":null},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:de1a1378332b9c3237c0953e8130a1fbaf59ebe3d946f60452030d7f59d07095","observation_id":"afcba079-64b8-4e3e-ae7d-5b6cbcf93483","resolution":{"observed_at":"2026-05-23T01:15:18.513854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"44eb65e1-86e4-4a11-adb5-d3fd129897e1","year":null},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:a5ee221eb100fad9b874f1ceeafa99fad4a1eaaeb6a5d51059dab1b1efdf79be","observation_id":"ee2e4734-419e-463b-9803-3a8b807a24d2","resolution":{"observed_at":"2026-05-23T01:15:18.510143Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"803de094-556d-473f-b4b1-c0b6cc5c9b44","year":null},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:12cef095def9c4a4c8b0ffcc44ae48759261e212829ac96793d26d2516baf6b7","observation_id":"cc3d4649-3672-4fd2-80a2-53745af9c675","resolution":{"observed_at":"2026-05-23T01:15:18.507120Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"13c27f13-45d3-4a23-a00f-74049027a017","year":null},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:06ec3efce3f9db35e776f2b770bbd06abf76a08efff75f9789f46163a7e76d19","observation_id":"11f0fb02-9e1d-4821-9e3e-14599f2dd333","resolution":{"observed_at":"2026-05-23T01:15:18.504367Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","latest_version":3,"primary_category":"cs.HC","snapshot_observed_at":"2026-08-11T12:49:44.531413Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":2,"verified_fuzzy":43},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 6 inbound Pith citation observations for arXiv:2503.16492."}