{"as_of":"2026-08-18T17:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:57b40f1edc008fa654a6b286c757fb9de6b8cb2f380fd0cb687e11a09a9f84bf","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:13:46.416331Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:49:00.343580Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T08:06:01.192545Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"cited_work":{"arxiv_id":"2505.19628","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19628","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"10cdd54b-0b4a-4cd0-950f-e5164984a784","year":2025},"citing_paper":{"arxiv_id":"2604.10110","last_updated":"2026-04-11T09:08:27Z","snapshot_observed_at":"2026-08-13T14:52:06.768478Z","submitted_at":"2026-04-11T09:08:27Z","title":"Trust Your Memory: Verifiable Control of Smart Homes through Reinforcement Learning with Multi-dimensional Rewards","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T16:49:00.343580Z"},"links":{"cited_paper":"/paper/2505.19628","citing_paper":"/paper/2604.10110"},"observation_digest":"sha256:2d556b91561470878dd21db5c4e0263372b253d52051bc1d6773bc2c3a5d2025","observation_id":"67e97ba2-b040-449f-9305-0db01b761fa7","resolution":{"observed_at":"2026-05-11T08:06:01.194278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19628/citation-record","integrity":"/paper/2505.19628/integrity","json":"/paper/2505.19628/citation-record.json","paper":"/paper/2505.19628"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:43.286394Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:43.286394Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:53606e628809c4f5e1319d70a719a8072df70a3dfb88fb1a064a7d78f86d83b8","observation_id":"ca779509-a425-44b4-9fa3-f4ef2c4c499d","resolution":{"observed_at":"2026-08-07T14:13:43.286394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:43.332298Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:43.332298Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:a82ea5640070ff0c63d2533eeb4f8e91b241b3890e8f6e784f062d6230afb3c7","observation_id":"cb005e0f-90ed-4f99-afd6-8167ec8e821e","resolution":{"observed_at":"2026-08-07T14:13:43.332298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:43.401630Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:43.401630Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:c6e999a5013597c01669726ae0e0ce2f8ea122b7aaff103cf45c9efc8b8f67d0","observation_id":"f38b1d5c-48af-4d74-89f6-b42bfb1c031f","resolution":{"observed_at":"2026-08-07T14:13:43.401630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:43.447722Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:43.447722Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:9589ea649375b8a4f1fb1f7ea8b3ce59f6f50b064a7b2b28c6900c22769fb9ae","observation_id":"1bc9f33c-a524-4b3f-a735-159590340752","resolution":{"observed_at":"2026-08-07T14:13:43.447722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.349","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"b3a9d0f2-a43b-4fbc-ba9e-263956c14cd0","year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:43.518635Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:f5e1981302fb3a2bd983d99cc25b3f441eb60379927d7aad4e3864d75c0b56e3","observation_id":"ffdc149e-af48-4b85-845e-2283c2222422","resolution":{"observed_at":"2026-08-07T14:13:47.038230Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:43.596796Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:43.596796Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:474b84b23fc0b55c86b2d6c4df115b198abe424874804825c52078122fdb6d93","observation_id":"e24cc3aa-82ed-49a7-85cc-add338d9f79f","resolution":{"observed_at":"2026-08-07T14:13:43.596796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01238","last_updated":"2025-03-20T20:43:37Z","snapshot_observed_at":"2026-08-16T13:38:09.060308Z","submitted_at":"2024-07-01T12:32:38Z","title":"Large Language Models are Zero-Shot Recognizers for Activities of Daily Living","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01238","snapshot_observed_at":"2026-08-07T14:13:43.689317Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:43.689317Z"},"links":{"cited_paper":"/paper/2407.01238","citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:2a226984b16d861f88d8205f1d05aebac1d2cae3c9ffd9206cb1e6182c15c74b","observation_id":"e0ab7e4e-ab18-43e9-917e-aac7f15078b0","resolution":{"observed_at":"2026-08-07T14:13:43.689317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:13:43.827804Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:43.827804Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:1a48d06983e383c44c7a5e7a10b748608aa2589d24de28cf51c974048bb05078","observation_id":"d5983e5f-bc04-459b-ad06-7655a5931430","resolution":{"observed_at":"2026-08-07T14:13:43.827804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T14:13:43.943987Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, , and et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:43.943987Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:58bf28d46b8c83a47b5f6c04b474352efe06bdd537e398c622a8c90c93fa8da8","observation_id":"8d08fffd-95fd-4b38-9247-f9eb368a9c73","resolution":{"observed_at":"2026-08-07T14:13:43.943987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:44.021942Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.021942Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:54251fc269851a042c4146b6fd925455cd3d4c2d30b1adea162426f8e443fad4","observation_id":"982d5f22-036a-4502-904c-699d83bda242","resolution":{"observed_at":"2026-08-07T14:13:44.021942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:13:44.078034Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.078034Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:323f668ecd49fac4a56f2a6d7823c0e2949dd0152e1629c0b6c7120375f739c6","observation_id":"8eaf745e-3a1c-442d-bfcc-08fc2a7afbef","resolution":{"observed_at":"2026-08-07T14:13:44.078034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:44.123347Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.123347Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:6fb29f0f857cc6b310e0c323e79f92efad7526110828b918d84c541e556b0af4","observation_id":"ca693e1d-bc1f-4e52-896e-3e0424899991","resolution":{"observed_at":"2026-08-07T14:13:44.123347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:44.188978Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.188978Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:95b089f1c62259dd672033e26fe5779da32ed4f9f4d43b4e11e441cd4ce28cb8","observation_id":"c42b9d1a-6942-44fc-bf21-2974ec21e6b4","resolution":{"observed_at":"2026-08-07T14:13:44.188978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:44.249236Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.249236Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:e89fad592367c89916e22cb8f86404ba41b8f832b6452f187f5c5b1192f19f9c","observation_id":"fd8da448-0293-4630-acc9-fa3f5e5a9085","resolution":{"observed_at":"2026-08-07T14:13:44.249236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T14:13:44.301981Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.301981Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:df351326c99ef57bfa679efdd14b52404cca20bf4cf18fc7fab470d2c625283d","observation_id":"6e7c4829-9483-439d-856f-24481277b628","resolution":{"observed_at":"2026-08-07T14:13:44.301981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:48.121777Z","title":null,"venue":null,"work_id":"46a48333-c32b-4f24-b4cf-ebf5d2f32a2a","year":2020},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.360111Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:8aa8a39f9ae79d56c70b6f635e65729c71aa313bd77cf78f8c83d9179becb0ba","observation_id":"d8600576-ea32-438d-8979-7924446d81fa","resolution":{"observed_at":"2026-08-07T14:13:48.152087Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:44.432119Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.432119Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:57b4b5ae27f646f981a2c5e76f5760fa4a706373b5fd5ca562e3a4e39acc85b2","observation_id":"96a779d5-3ddc-4015-a79f-ce5ddfe19c45","resolution":{"observed_at":"2026-08-07T14:13:44.432119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:44.488889Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.488889Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:c6dd979c01e236ddb45ad04703c131e51e0d3f1f44a8266d1d2bed85140210df","observation_id":"2c760aaa-4be0-40a2-b93b-de322bf81128","resolution":{"observed_at":"2026-08-07T14:13:44.488889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:44.566701Z","title":"u ttler, Mike Lewis, Wen-tau Yih, Tim Rockt\\","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.566701Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:d99158679d1cce5ace35f27aaaa54b62610ecef2de5187691dce34b24816f681","observation_id":"dd151f6a-6fed-468b-b982-f13c2fee6987","resolution":{"observed_at":"2026-08-07T14:13:44.566701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.162","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"7dc0c970-5668-4567-86fe-b81600f755ac","year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.625657Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:d99b4180764a5b5f7a9391acdc61b68c4e6a2c58d93fa010b094758237674f73","observation_id":"1b39ce1c-0e88-4199-91e8-edb78905e3b7","resolution":{"observed_at":"2026-08-07T14:13:46.865885Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:44.668875Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.668875Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:6d998d6be02d1f88c13f93df9d85d06efa3f025672e4f839bb453d9aaafa293a","observation_id":"f3156878-3b6e-4ab3-a2f1-53f3ad017a88","resolution":{"observed_at":"2026-08-07T14:13:44.668875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:44.726154Z","title":"like having a really bad pa","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.726154Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:314fa9d67b5d2bedf1ca169d85079702da53e26eaf0452ecbe5f3ba4fb39e52f","observation_id":"3b457e4d-8d6c-4b18-8eed-acca80c3ce9b","resolution":{"observed_at":"2026-08-07T14:13:44.726154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06807","last_updated":"2025-02-18T22:21:40Z","snapshot_observed_at":"2026-08-16T21:32:22.938353Z","submitted_at":"2025-02-03T23:00:15Z","title":"Competitive Programming with Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06807","snapshot_observed_at":"2026-08-07T14:13:44.797973Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.797973Z"},"links":{"cited_paper":"/paper/2502.06807","citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:e82a6207d5670b2ca432a66c718651a79e45f1bf5354dbe25ff67947d1a77170","observation_id":"4812c028-8191-471b-8303-c72322123e79","resolution":{"observed_at":"2026-08-07T14:13:44.797973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2017.82613","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:47.631806Z","title":"Praveen Kumaar, U","venue":null,"work_id":"ce563788-bdd2-4187-a176-232479241ec9","year":2017},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.868342Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:53d02102ddf9ad45128dbb04729a77fdc5d31b324118cc1e1edeb6b5116f7f45","observation_id":"020fa3ac-ea1b-4458-8cf9-3fdc45eb4b16","resolution":{"observed_at":"2026-08-07T14:13:47.681768Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.34719","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:47.463487Z","title":null,"venue":null,"work_id":"c6999279-dc86-42a2-974d-f386e4f9e3e9","year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.922876Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:7fa385244b003cf6a350d92d58b34c07e22124a11f7bff686ae77dabdfe2cd0d","observation_id":"bb102c00-d36d-448e-97b6-969123654b5b","resolution":{"observed_at":"2026-08-07T14:13:47.506614Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12687","last_updated":"2024-08-22T19:00:50Z","snapshot_observed_at":"2026-08-16T13:24:29.312613Z","submitted_at":"2024-08-22T19:00:50Z","title":"Bridging the gap between natural user expression with complex automation programming in smart homes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12687","snapshot_observed_at":"2026-08-07T14:13:44.981357Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:44.981357Z"},"links":{"cited_paper":"/paper/2408.12687","citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:31417f1b19824630e4ada31ec1bb3daa49cf213c372b162ee1f25f2e6a035e2f","observation_id":"10d20b22-55eb-4ffe-a916-b8de84db9a19","resolution":{"observed_at":"2026-08-07T14:13:44.981357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:45.077406Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:45.077406Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:b2782bedf23e3cd9e06d68040f3a39fb75275ca7ec9a65aea6fb344df9441dff","observation_id":"022d383b-d040-4c3d-817c-0ac2effee50d","resolution":{"observed_at":"2026-08-07T14:13:45.077406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:45.123799Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:45.123799Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:954c80bbd21b0416a34bfb2157f89b62c6facdb9c3c5886246ac3f6442c4baca","observation_id":"4c7f68ac-9775-4b51-932e-0896e9f657e7","resolution":{"observed_at":"2026-08-07T14:13:45.123799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-07T14:13:45.175232Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:45.175232Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:40f24ebf8d2d7eb1072a09839e2b0d452d46ed4baced9c169b53502aee9d9444","observation_id":"0d691a22-4fe4-429e-b811-560c424c361e","resolution":{"observed_at":"2026-08-07T14:13:45.175232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:45.226150Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:45.226150Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:4bc872f9cdbc753873b21dfbbfa2078479894b1dd977c3ae690c68a223e9c841","observation_id":"edbbc504-43f3-4f0a-9833-bccf119e22b4","resolution":{"observed_at":"2026-08-07T14:13:45.226150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11230","last_updated":"2025-02-11T02:17:24Z","snapshot_observed_at":"2026-08-16T13:42:24.755270Z","submitted_at":"2024-06-17T05:54:06Z","title":"Multimodal Needle in a Haystack: Benchmarking Long-Context Capability of Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11230","snapshot_observed_at":"2026-08-07T14:13:45.327655Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:45.327655Z"},"links":{"cited_paper":"/paper/2406.11230","citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:d04befc45d05d85bf7ac143d94631db7fbaf8e632462d6a29e88f7a7cd39a712","observation_id":"2fa3711e-49f6-4feb-9648-7f5c95afec56","resolution":{"observed_at":"2026-08-07T14:13:45.327655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:45.391587Z","title":"Pan, and Kam-Fai Wong","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:45.391587Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:34374ae7c0c10a47aaccca44485bfebcfe4e10367f464d6eae98ff03229427f7","observation_id":"5d38553f-317a-4060-863c-76aa7ef00005","resolution":{"observed_at":"2026-08-07T14:13:45.391587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:45.442931Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:45.442931Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:09a4f10dfe78a5ba01cfb741b8fd5af3e77292c70c3314421dcf4a9aa046163a","observation_id":"2781f30f-e5be-4091-91ba-81146de4b90c","resolution":{"observed_at":"2026-08-07T14:13:45.442931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12896","last_updated":"2024-10-16T16:12:39Z","snapshot_observed_at":"2026-08-16T13:08:44.642036Z","submitted_at":"2024-10-16T16:12:39Z","title":"A Survey on Data Synthesis and Augmentation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12896","snapshot_observed_at":"2026-08-07T14:13:45.557406Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:45.557406Z"},"links":{"cited_paper":"/paper/2410.12896","citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:8a70d34a84fff3b866580fe416076da18df8d20d938d45b8acf5b856ebd39a15","observation_id":"12a817a1-34b2-46a4-a609-761c5e7dcc88","resolution":{"observed_at":"2026-08-07T14:13:45.557406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:45.638122Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:45.638122Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:7f0787ff5ac112b43402e9058644871daafb03a036076d1f05fdfee8c3fd8b48","observation_id":"2ee4f3d0-7f11-4bdc-a415-12a24f8a0a64","resolution":{"observed_at":"2026-08-07T14:13:45.638122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:13:45.785723Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:45.785723Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:fca535ab1fb6c46a4e80fa5cdc722a1b29b798b5b71f3815b03b4b15899d09a6","observation_id":"e718eefb-c8c9-4cf3-a15d-01ae47e3c267","resolution":{"observed_at":"2026-08-07T14:13:45.785723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14252","last_updated":"2025-08-11T08:16:03Z","snapshot_observed_at":"2026-08-16T13:08:07.653661Z","submitted_at":"2024-10-18T08:02:36Z","title":"Harmony: A Human-Aware, Responsive, Modular Assistant with a Locally Deployed Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14252","snapshot_observed_at":"2026-08-07T14:13:45.895559Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:45.895559Z"},"links":{"cited_paper":"/paper/2410.14252","citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:7c67b8ac0fe5d2690c7e9099797f4e252d233006b9c4207a0ca8c88f0328988e","observation_id":"40919995-ee9e-4db0-9295-cb9ef0b33866","resolution":{"observed_at":"2026-08-07T14:13:45.895559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5730.34941","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:47.217116Z","title":null,"venue":null,"work_id":"092c6950-3080-4440-a4fd-6e133d7a9793","year":2021},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:45.993617Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:9aa38c8d06ef07740c20dfbf0ae8c3e3cad23ef56097184a69fd2d75fe8a034d","observation_id":"3149cf74-4e69-4a1e-a3f2-abcf0dbb7063","resolution":{"observed_at":"2026-08-07T14:13:47.251718Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3698145","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"Proceedings of the ACM on Human-Computer Interaction","work_id":"e7e4ca1d-d936-4fd0-aff0-bde92e2e60d9","year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:46.073671Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:e19bf52de680c19560c98bf54ed14898a91a176e62646236cd5387159fb4cfc7","observation_id":"40616f42-4bfc-44ed-a98d-525a23f31ef1","resolution":{"observed_at":"2026-08-07T14:13:46.704433Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:47.997286Z","title":null,"venue":null,"work_id":"9881ad7a-117e-4b68-bd27-c5f10fa4b3fb","year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:46.114763Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:489d5793f5b92b06b8c11242232b84eca5679bf90dc0907da2135d9953d026f7","observation_id":"6dd3210c-fb31-493d-ba84-9c27ec37629e","resolution":{"observed_at":"2026-08-07T14:13:48.046690Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01630","last_updated":"2024-09-03T05:56:50Z","snapshot_observed_at":"2026-08-16T13:21:53.604535Z","submitted_at":"2024-09-03T05:56:50Z","title":"SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01630","snapshot_observed_at":"2026-08-07T14:13:46.175242Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:46.175242Z"},"links":{"cited_paper":"/paper/2409.01630","citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:cb4e32e4c6fbd88f9fc590c4de051415d7e79ea3925f3ccdbcc7cf40765da186","observation_id":"dffd87c4-d69a-420e-8ed5-2f396c91873f","resolution":{"observed_at":"2026-08-07T14:13:46.175242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:46.240725Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:46.240725Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:e2a0cba4ee3fa6534f68d7d0a6c21cda117aa3f04905ba295dccfe6b181d707b","observation_id":"48aa503a-b397-4579-b8fd-138712327a65","resolution":{"observed_at":"2026-08-07T14:13:46.240725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:46.299358Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:46.299358Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:c51ea33294d1eea7da855b930dad51424ffeb1caff9b28d70ab80aba82dd797c","observation_id":"2198b13f-03df-486c-a0f4-322e42bc8651","resolution":{"observed_at":"2026-08-07T14:13:46.299358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.155","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"000729eb-82e6-49d2-8990-ea116bad0aa6","year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:46.357862Z"},"links":{"citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:e279a3ecc2c2aa4740f744eac64a0aee48b62d07258c02c29c89e936f437989a","observation_id":"0fd12fc8-5012-47ab-9751-8a7f72cb6add","resolution":{"observed_at":"2026-08-07T14:13:46.563819Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04449","last_updated":"2024-11-28T12:28:02Z","snapshot_observed_at":"2026-08-16T13:27:41.223643Z","submitted_at":"2024-08-08T13:19:37Z","title":"EARBench: Towards Evaluating Physical Risk Awareness for Task Planning of Foundation Model-based Embodied AI Agents","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04449","snapshot_observed_at":"2026-08-07T14:13:46.416331Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:46.416331Z"},"links":{"cited_paper":"/paper/2408.04449","citing_paper":"/paper/2505.19628"},"observation_digest":"sha256:ae9fb225ae420a417488a6448cda0900c970336860a145add31efd672643092f","observation_id":"e447815a-8dc2-4951-bb7f-5fb5c1d6b12a","resolution":{"observed_at":"2026-08-07T14:13:46.416331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19628","last_updated":"2025-05-27T07:26:36Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T13:36:16.137804Z","submitted_at":"2025-05-26T07:47:39Z","title":"HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":38,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2505.19628."}